Статия, публикувана в Apple Machine Learning Research и в arXiv, сравнява най-добрите отворени „harness“-и за автономно машинно обучение с един coding agent, който има само четене, писане и bash. При равен времеви бюджет и същия модел надстройките не дават предимство. Авторите заключават, че ръчно строените скелета около силни модели се отплащат зле.
- Авторите са Kirill Brilliantov, Alejandro Hernández-Cano и Emmanuel Abbé от EPFL; Hernández-Cano е работил по статията, докато е бил в Apple.
- Изводът е за текущите бенчмаркове по машинно обучение: оркестратори и подагенти за извличане стават излишни в режима на coding agent.
- Същата седмица браншът върви обратно: все повече оркестрация около модела.
Четене, писане, bash. Три команди и една сесия. Това е целият „агент“, срещу който авторите пускат най-сложните отворени системи за автономно машинно обучение, с оркестратори и подагенти. И той не губи.
Чакай малко, преди да изтриеш оркестратора си. Изводът е ограден два пъти: „текущи MLE бенчмаркове“ и „равен времеви бюджет“. Това е автономно машинно обучение, задача с ясен резултат и ясно мерене. Твоят агент, който пише оферти и говори с клиенти, не е в тая извадка, и статията не твърди нищо за него.
Но посоката боли. Цял бранш в момента строи надстройки: подагенти, памет, маршрутизатори, рецензенти, и тази седмица излязоха още такива. А тук идва статия през Apple, която казва: при силен модел това е тежест, не крила. Пластовете са измислени, за да пазят от слаб модел. Моделът вече не е слаб, а пластовете останаха.
Какво правим ние с това: всеки пласт в нашите агенти трябва да докаже, че носи резултат при равно време, срещу голата сесия със същия модел. Не докаже ли, пада. Статията дава метода, а числата за твоята задача ги вадиш сам, защото никой друг няма да ги извади за теб.