Как една лаборатория решава, че моделът ѝ е станал твърде опасен за обикновено пускане. Отговорът е в документи с имена като Preparedness Framework и Responsible Scaling Policy, а новата дума е довод за безопасност.
Помисли за асансьора в блока. Вътре има табелка с максимален товар и дата на последната проверка. Почти никой не я чете, но всички разчитат, че някой е проверил. Праговете на лабораториите са табелката. Въпросът е кой проверява.
Как работи прагът
По рамката на OpenAI от април 2025 модел на ниво High може да усили вече съществуващи пътища към тежка вреда и трябва да има достатъчни защити, преди да бъде пуснат. Ниво Critical може да отвори нови пътища, каквито досега не е имало, и тогава защитите са нужни още докато моделът се разработва. На 1 септември 2026 OpenAI обяви Astra за първия си модел на ниво Critical по киберсигурност и забави части от пускането, докато подсили защитите.
Слабото място е, че и табелката, и проверката са на компанията. На 6 септември главният учен на OpenAI Якуб Пахоцки написа, че такива рамки трябва да станат широко задължителни прагове, налагани от външни одитори, държавни агенции или международни органи.
Доводът за безопасност
На 28 септември 2026 OpenAI предложи, преди всяко голямо обучение с подкрепление да има писмена документация за безопасност, в идеалния случай на нивото на доводите за безопасност от авиацията и ядрената енергетика. Самата компания признава, че това е цел, към която гради, и че при AI е по-трудно, защото всяко ново ниво на способности носи нова сложност. Сред предложенията ѝ: всеки довод да получава писмено възражение от друг екип, а всеки от ръководителите, които го одобряват, да може да спре обучението.