Три теста, три съвсем различни идеи какво значи „добър“ AI модел - и една обща слабост, за която никой не обича да говори.
Терминалът е черният екран, в който пишеш команди с текст, вместо да кликаш с мишката - там живее истинската работа на всеки програмист и системен администратор. Terminal-Bench е тест, направен от университета Станфорд заедно с Laude Institute, изследователска фондация за AI оценки, и проверява точно това: пуска модела в затворена дигитална кутия и му дава 89 реални задачи - инсталирай сървър, оправи счупен код, обучи малък модел. Няма познавач, който чете отговора и кима одобрително. Програма проверява дали крайният резултат наистина работи, също като изпитание в цех.
GDPval е дело на OpenAI, компанията зад ChatGPT, и прави нещо по-близко до истинския живот: взима задачи от 44 професии - счетоводство, право, инженерство - и кара модела да произведе истинска таблица, документ или чертеж. После истински специалисти с дългогодишен опит сравняват резултата на модела с работата на колега, без да знаят кое от двете е човешко. Тук няма правилен отговор в кутийка. Има само качество на свършена работа.
Arena, позната по-рано като Chatbot Arena, върши нещо съвсем различно: пита обикновени хора. Пускаш въпрос, получаваш два анонимни отговора и гласуваш кой ти харесва повече. От тези гласове системата подрежда моделите по Elo, точкова система, измислена да подрежда шахматисти по сила на играта. Хубавото е, че мери вкус, а не само знание. Лошото е, че мери само вкус.
И тук идва капанът, който никой от трите теста не решава напълно. Всеки от тях е публикуван, задачите му се обсъждат във форуми, коментират се в статии, влизат в архиви. А новите модели се тренират върху целия този публичен текст. Възможно е моделът просто да разпознава задачата, без изобщо да я решава - защото вече я е виждал, с отговора включен.
Зад блясъка
Точките на екрана ме вълнуват по-малко от едно нещо: дали инструментът върши реална задача пред мен - в реално време, без да съм му подсказал предварително отговора. Затова гледам на всеки нов рекорд в Terminal-Bench или GDPval с половин уважение и половин вдигната вежда.
Проблемът с изтеклите теми не е дребна техническа подробност - той разяжда самата идея за сравнение. Ако не знаем кое парче знание идва от истинско разсъждение и кое от запомнен отговор, точките са просто украса на таблица. Вярвам на резултата едва когато го видя да работи пред очите ми, върху моя собствена, непубликувана задача.