we_are_coded.by CODE · Светът, декодиран
EN
Понятие

Embedding: когато смисълът получи адрес

ОсновитеОбновено на 7 октомври 2026we are coded

Embedding превръща дума, снимка или звук в редица числа - нещо като адрес на карта на смисъла. Близките по смисъл неща получават близки адреси. Затова търсачката намира „евтин хотел до морето“, дори когато в текста пише „бюджетна стая на плажа“.

Проверено на7 октомври 2026
Накратко: embedding (ембединг, векторно представяне) е списък от числа, с който модел описва смисъла на парче съдържание - изречение, снимка, звук. Тези числа работят като координати: неща с близък смисъл получават близки координати, далечните - далечни. Списъкът се нарича вектор. Моделът, който го прави, не пише отговори, той само подрежда. На това стъпват търсенето по смисъл, RAG и намирането на снимка по описание.

Представи си библиотека, в която книгите не са подредени по азбучен ред, а по смисъл. Готварските стоят в един ъгъл, а книгата за италианската кухня е на педя от тази за пастата, макар заглавията им да нямат обща дума. Embedding прави точно това с всяко изречение и всяка снимка: дава им място в такава библиотека. Мястото е записано с числа, стотици на брой (при EmbeddingGemma 2 до 768), затова никой не може да го нарисува, но машината може да го измери.

Старото търсене сравнява букви. Пишеш „кола“ и то намира текстовете, в които стои „кола“. Текстът за „автомобил“ остава навън. Търсенето с embedding сравнява адреси. Въпросът ти също получава място в библиотеката, и машината просто взима книгите, които стоят най-близо до него. Затова намира отговора, дори когато думите са различни. И затова понякога намира нещо близко, но не точното: близостта не е същото като вярност.

Къде го срещаш, без да го виждаш

В търсачката на сайт, която разбира какво питаш. В RAG, системата, при която чатботът първо търси в твоите документи и чак после отговаря: точно embedding решава кои пасажи са по темата. В телефона, когато напишеш „куче на плаж“ в галерията и излизат снимки, на които никой не е слагал етикет. Навсякъде, където машината търси подобното, без да има точно съвпадение.

Поводът да го обясним сега е малък модел. На 6 октомври 2026 Google пусна EmbeddingGemma 2: отворен модел с 740 милиона параметъра, върху архитектурата Gemma 4, с лиценз Apache 2.0, който позволява и търговска употреба. Той слага текст, код, картинки, видео и аудио в едно общо пространство, една библиотека за всичко. Така гласова бележка може да намери видеоклип, а текстов въпрос - място в часове аудиозаписи. Направен е да работи на самото устройство, дори без интернет. По данни на Google първият EmbeddingGemma, само за текст, е свален над 20 милиона пъти.

Embedding не знае кое е вярно. Знае само кое до кое стои.

Затова малкият размер е новината. Модел, който подрежда смисъла на телефона ти, значи, че снимките, бележките и записите ти могат да се търсят по смисъл, без да напускат телефона. За данните ти това тежи повече от всяко число в таблиците с резултати. Проверката е денят, в който го срещнеш в приложение, което вече ползваш.

Визуалът е генериран код-арт, без чужди изображения.
Официални първоизточници
→Google: EmbeddingGemma 2 (06.10.2026)