we_are_coded.by CODE · Светът, декодиран
EN
Понятие

Мултимодален модел

ОсновитеОбновено на 16 август 2026we are coded

Модел, който освен думи чете и снимка, звук, видео, все едно има повече от едно сетиво.

Проверено на16 август 2026
Накратко: обикновен модел за AI разбира само думи, все едно чете писмо, без да вижда снимката, залепена към него. Мултимодалният модел има повече от едно сетиво: чете, гледа снимки, слуша звук, следи видео. Затова може да превърне едно изречение в картина. А при роботите превръща това, което камерата вижда, в движение на ръката.

Представи си, че обясняваш по телефона на приятелка как изглежда роклята, която си купила. Тя те слуша, но не вижда нищо. Сега си представи, че ѝ пращаш и снимка. Изведнъж разбира много повече, с по-малко думи. Точно това е разликата между модел, който само чете текст, и модел, който освен текст вижда и картина. Второто сетиво не замества първото, добавя се към него.

От тук идва и изразът text-to-image, буквално от думи към картина. Пишеш изречение като „котка, седнала на прозорец, вечерна светлина“ и моделът рисува точно това. Не защото е художник в класическия смисъл, а защото е свързал думите, които сме му показали хиляди пъти, със снимките, които са вървели редом с тях. Научил е кое как изглежда.

При роботите нещата стават по-осезаеми. Робот в склад има камера вместо очи. Камерата праща пиксели, същите онези точки, от които е съставена всяка цифрова снимка, към модела. Моделът гледа тези пиксели и решава: тази кутия е отляво, ръката трябва да се завърти натам и да я хване. От пиксели към действие, без човек да натиска бутон на всяка крачка.

Мултимодалният модел не е по-умен, защото знае повече думи. По-умен е, защото свързва сетивата, както го правим ние.

През окото, не само през думите

Аз съм дизайнер, затова тази тема ми е близка отвътре. Цял живот работя с хора, които ми обясняват идея с думи, а аз я виждам едва когато ми покажат мудборд или скица. Текстът сам по себе си винаги е бил недостатъчен за мен.

Затова когато AI спря да чете само текст и започна да гледа снимки, за мен това не беше технически детайл. Беше моментът, в който машината започна да мисли малко по-близо до това как мисля аз, през окото, не само през думите.

Визуалът е генериран код-арт, без чужди изображения.
Официални първоизточници
→Google: Gemini - natively multimodal (6 декември 2023)