Езиковият модел предсказва следващата дума. Световният предсказва следващия миг: къде ще падне чашата, как ще се завърти ръката на робота, какво ще се появи на екрана след клика ти. Тук роботиката, видеото и интерфейсите се срещат.
Когато хвърляш топка на дете, то не смята параболи. Просто знае къде ще падне, защото хиляди пъти е гледало как падат неща. Световният модел трупа същото усещане от видео. Гледа достатъчно, за да може сам да продължи сцената.
Три примера от една есен
На 22 септември 2026 Black Forest Labs, създателите на генератора на картини FLUX, пуснаха FLUX 3 Action: модел с отворени тегла и 7 милиарда параметъра, който предсказва едновременно бъдещите кадри и действията на робот. Самите те го наричат модел свят-действие.
NVIDIA ползва платформата Cosmos за роботи и коли без шофьор: тя симулира как се държи физическият свят, за да може системата да се тренира и проверява без истинския път. А на 31 август 2026 Runway показа Solaris, първия модел от семейство, което нарича Interface World Models. Там светът е самият интерфейс: приложението се рисува кадър по кадър, докато го ползваш.
Честно за границите
Да предскажеш кадъра още не значи да разбираш физиката. Моделът може да покаже убедително видео, в което невъзможното изглежда нормално. Затова в роботиката го мерят по това колко задачи роботът изпълнява. FLUX 3 Action например решава малко над 42% от задачите в RoboLab-120, тест в симулация, по данни на компанията.