Модел, който освен думи чете и снимка, звук, видео, все едно има повече от едно сетиво.
Представи си, че обясняваш по телефона на приятелка как изглежда роклята, която си купила. Тя те слуша, но не вижда нищо. Сега си представи, че ѝ пращаш и снимка. Изведнъж разбира много повече, с по-малко думи. Точно това е разликата между модел, който само чете текст, и модел, който освен текст вижда и картина. Второто сетиво не замества първото, добавя се към него.
От тук идва и изразът text-to-image, буквално от думи към картина. Пишеш изречение като „котка, седнала на прозорец, вечерна светлина“ и моделът рисува точно това. Не защото е художник в класическия смисъл, а защото е свързал думите, които сме му показали хиляди пъти, със снимките, които са вървели редом с тях. Научил е кое как изглежда.
При роботите нещата стават по-осезаеми. Робот в склад има камера вместо очи. Камерата праща пиксели, същите онези точки, от които е съставена всяка цифрова снимка, към модела. Моделът гледа тези пиксели и решава: тази кутия е отляво, ръката трябва да се завърти натам и да я хване. От пиксели към действие, без човек да натиска бутон на всяка крачка.
През окото, не само през думите
Аз съм дизайнер, затова тази тема ми е близка отвътре. Цял живот работя с хора, които ми обясняват идея с думи, а аз я виждам едва когато ми покажат мудборд или скица. Текстът сам по себе си винаги е бил недостатъчен за мен.
Затова когато AI спря да чете само текст и започна да гледа снимки, за мен това не беше технически детайл. Беше моментът, в който машината започна да мисли малко по-близо до това как мисля аз, през окото, не само през думите.