we_are_coded.by CODE · Светът, декодиран
EN
Понятие

VLA: от пиксели към движение

ОсновитеОбновено на 16 август 2026we are coded

Роботът вече не повтаря едно и също движение хиляди пъти. Гледа, чете думите ти и сам решава как да хване чашата.

Проверено на16 август 2026
Накратко: VLA (vision-language-action, зрение-език-действие) е модел, който гледа през камера, чете задача на нормален човешки език и веднага произвежда движение на робот. Без ред код между двете. Казваш „вдигни синята чаша, остави я до чинията“ и ръката тръгва - без някой предварително да е програмирал точно това движение.

Досегашният индустриален робот е сляпо повторение. Инженер записва траектория - ръката се завърта на 37 градуса, захваща с точно определена сила - и машината я повтаря хиляди пъти на същото място, до милиметър. Мръдне ли частта с два сантиметра встрани, роботът не я вижда. Той няма очи, има само памет за едно-единствено движение. VLA обръща логиката: вместо да запомня движение, моделът гледа сцената в момента, разбира какво иска човекът и сам преценява как да го направи.

Отвътре VLA е три различни неща, слети в едно. Влиза образ от камерата - суровите пиксели на масата, чашата, ръката. Влиза изречение на естествен език - задачата с думи. И излиза поток от числа: колко градуса да завърти всяка става, колко здраво да стисне захватът, кога да спре. Моделът е обучен на огромно количество записи - хора и роботи, изпълняващи хиляди дребни битови задачи - докато научи връзката между това, което вижда, това, което чува като инструкция, и движението, което трябва да последва.

Първият модел, който доказа, че това изобщо работи извън лабораторни идеални условия, беше RT-2 на Google DeepMind (изследователското звено на Google за изкуствен интелект) през 2023. След него дойде OpenVLA - отворен модел, който всеки изследовател може да свали и да пипа - и pi0 на Physical Intelligence, стартъп на бивши инженери от Google и Tesla (производителят на електромобили), фокусиран точно върху роботи, които вършат домакинска работа: сгъват дрехи, товарят миялна машина.

Разликата, която реално има значение, е генерализацията. Стар робот, обучен да вдига червена чаша, разпознава само нея - синя чаша за него е различен обект, различна задача, изисква нова програма. VLA моделът е видял толкова много разновидности на 'хващане на предмет' по време на обучението, че прехвърля наученото и върху нещо, което буквално не е срещал. Не е запаметил движение. Разбрал е задачата на ниво език и я превежда сам в действие всеки път наново.

Крехкото място е скоростта и надеждността. Тези модели все още работят по-бавно от заучена индустриална програма и правят грешки там, където старият робот никога не бърка - защото той изобщо не мисли, само повтаря. VLA мисли всеки път - а мисленето отнема време и понякога излиза грешно. Затова засега тези системи живеят предимно в изследователски центрове и демонстрации, не на конвейерна лента.

Окото е свързано директно с ръката - между тях няма ред код, който да чака да бъде написан за всяко ново движение.

Ето къде е номерът

Двайсет години гледам как машините правят точно едно нещо, страхотно добре, и нищо друго. Печатарска машина реже точно тази форма. CNC фреза следва точно този файл. Всяка нова задача означава нов файл, нова настройка, нов човек, който да седне и да обясни на машината какво точно да прави, движение по движение. VLA е първият път, когато виждам машина, на която просто ѝ казваш какво искаш - и тя сама затваря разстоянието между думата и действието.

Не съм наивен по темата - гледал съм достатъчно демота, обучени да изглеждат перфектно точно пред камера, за да знам колко трудно е това извън контролирана стая. Но посоката е правилната и тя не е специфична за роботи с ръце. Всяка система, която строя - агент, който чете екран и кликва, автоматизация, която чете писмо и решава какво да направи с него - е същият принцип: зрение плюс език, директно в действие, без човек по средата за всяка стъпка. Роботиката просто го показва най-буквално, защото тук грешката пада на пода с трясък.

Визуалът е генериран код-арт, без чужди изображения.
Официални първоизточници
→Google DeepMind: RT-2 - Vision-Language-Action модели (юли 2023)