Anthropic пусна резултати от лаборатория, не от симулация. Външни оценители произвели и изпитали проектите на модела. Делът сполучливи е между 22 и 35 на сто при обичайни 10 до 15.
- Claude проектира малки белтъци срещу 15 мишени, успява срещу 14 от тях.
- Проектите са произведени и изпитани от външни лаборатории, не оценени на компютър.
- При химичен анализ друг модел свършва за 23 и 19 минути работа, която иска специалист.
Числото, което гледам, не е 14 от 15. То е делът сполучливи проекти: между 22 и 35 на сто, при обичайни 10 до 15.
Разликата е там, защото първото число казва дали изобщо става, а второто колко работа хвърляш на боклука.
И най-важното: това не е оценка на компютър. Проектите са отишли във външни лаборатории, произведени са и са изпитани физически.
Къде е уговорката
Числата са на Anthropic и мишените са познати, ползвани в състезания по проектиране. Две са били избрани нови нарочно, за да не са виждани при обучението. Това е честен ход, но проверката пак е тяхна.
Другото, което казват направо: задачите от науките за живота са блокирани в най-способния им модел, а достъпът за учени още се готви. Тоест публикуват резултат от инструмент, който не можеш да пипнеш.
Вторият опит ми говори повече от първия. Химик получава сурови данни от лаборатория и трябва да ги разчете. Работа за специалист, скучна и бавна. Моделът я е свършил за двайсетина минути от два реда указание, със същия отговор.
Това е формата, в която тези неща наистина влизат в работа. Не гениално откритие, а свалено чакане в средата на процеса.
Ако си в бранш, където чакаш специалист за нещо рутинно, следващите две години ще ти бъдат интересни.