we_are_coded.by CODE · Светът, декодиран
EN
Google DeepMind

Google пусна EmbeddingGemma 2: отворен модел от 740 млн параметри за търсене в текст, код, картинки, видео и аудио на самото устройство

Google · събитието: 6 октомври 2026Фронтир

Един общ „рафт“ за пет вида съдържание, който може да работи изцяло на устройството. По данни на Google пълната мултимодална версия, компресирана, иска около 567 MB памет на Pixel 11 Pro. Лицензът е Apache 2.0, а теглата са в Hugging Face и Kaggle.

Накратко
  • EmbeddingGemma 2 слага текст, код, картинки, видео и аудио в общо пространство. 740 млн параметри, архитектура Gemma 4, лиценз Apache 2.0.
  • По данни на Google иска около 567 MB активна памет за компресираната пълна версия на Pixel 11 Pro, а работи и офлайн.
  • Теглата са в Hugging Face и Kaggle. Първата версия, само за текст, има над 20 млн сваляния, по данни на Google.
Проверено на7 октомври 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

Записваш гласова бележка и по нея намираш видеоклипа, за който говориш. Примерът е на самия Google и е по-добър от всяка таблица.

Ето какво е embedding, с една картина. Представи си библиотека, в която нещата не са по азбука, а по смисъл: бележката за морето, снимката от морето и песента за морето седят на един рафт. Моделът подрежда всичко по рафтовете, а търсенето пита кое стои най-близо до твоя въпрос.

Фактите: на 6 октомври 2026 г. Google DeepMind (автори Sahil Dua и Henrique Schechter Vera) пусна EmbeddingGemma 2 - отворен лек модел за мултимодални embeddings, който нанася текст, код, изображения, видео и аудио в общо пространство. Върху архитектурата Gemma 4, лиценз Apache 2.0, 740 млн параметри. Първата версия от миналата година е само за текст и по данни на Google има над 20 млн сваляния. Контекстът е 8K токена: до 5,5 минути аудио, 29 картинки или 58 кадъра видео. По данни на Google, с квантизация (компресиране на теглата) на Pixel 11 Pro пълният мултимодален модел иска около 567 MB активна памет. По данни на Google в MTEB Code резултатът е 78,68, срещу 68,76 при предшественика. Теглата са в Hugging Face и Kaggle, а в Model Garden на Gemini Enterprise Agent Platform идват скоро.
Не помниш как се казва файлът. Помниш за какво е.

Числото, което те касае, е 567 MB. Толкова иска компресираната пълна версия на един телефон, по данни на Google. При такъв размер търсенето в твоите снимки, записи и клипове може да не излиза от телефона. Google го подава като предимство за поверителността и за скоростта: подреждането става на място и работи и без интернет.

Кодът е второто приложение. На теста за код Google отчита скок от почти 10 точки спрямо първата версия и сочи модела за локално индексиране на кодова база и за търсене от кодиращи агенти.

Не съм го пускал. Числата са на Google, а паметта е мерена на един модел телефон. Лицензът е Apache 2.0 и позволява търговска употреба, така че който прави приложение за снимки или бележки, вече има с какво да търси в тях, без да ги праща в облака.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→Google - EmbeddingGemma 2: an open, lightweight multimodal embedding model, 06.10.2026→Hugging Face - google/embeddinggemma-2 (теглата и лицензът Apache 2.0)
Оригинал: https://wearecoded.com/articles/google-embeddinggemma-2-740m-multimodalen.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини