we_are_coded.by CODE · Светът, декодиран
EN
Понятие

Праговете на опасност и доводът за безопасност

ОсновитеОбновено на 1 октомври 2026we are coded

Как една лаборатория решава, че моделът ѝ е станал твърде опасен за обикновено пускане. Отговорът е в документи с имена като Preparedness Framework и Responsible Scaling Policy, а новата дума е довод за безопасност.

Проверено на1 октомври 2026
Накратко: големите AI лаборатории сами си пишат прагове на опасност. Preparedness Framework на OpenAI има две нива, High и Critical, и три следени области: биологични и химични способности, киберсигурност и самоусъвършенстване на AI. Anthropic има Responsible Scaling Policy (RSP) от септември 2023, вече във версия 3.4. Доводът за безопасност (safety case) е следващата стъпка: писмен, структуриран аргумент с доказателства, че рискът е под контрол, какъвто се ползва в авиацията и ядрената енергетика.

Помисли за асансьора в блока. Вътре има табелка с максимален товар и дата на последната проверка. Почти никой не я чете, но всички разчитат, че някой е проверил. Праговете на лабораториите са табелката. Въпросът е кой проверява.

Как работи прагът

По рамката на OpenAI от април 2025 модел на ниво High може да усили вече съществуващи пътища към тежка вреда и трябва да има достатъчни защити, преди да бъде пуснат. Ниво Critical може да отвори нови пътища, каквито досега не е имало, и тогава защитите са нужни още докато моделът се разработва. На 1 септември 2026 OpenAI обяви Astra за първия си модел на ниво Critical по киберсигурност и забави части от пускането, докато подсили защитите.

Слабото място е, че и табелката, и проверката са на компанията. На 6 септември главният учен на OpenAI Якуб Пахоцки написа, че такива рамки трябва да станат широко задължителни прагове, налагани от външни одитори, държавни агенции или международни органи.

Праг, който компанията сама пише и сама проверява, е обещание, а още не е правило.

Доводът за безопасност

На 28 септември 2026 OpenAI предложи, преди всяко голямо обучение с подкрепление да има писмена документация за безопасност, в идеалния случай на нивото на доводите за безопасност от авиацията и ядрената енергетика. Самата компания признава, че това е цел, към която гради, и че при AI е по-трудно, защото всяко ново ниво на способности носи нова сложност. Сред предложенията ѝ: всеки довод да получава писмено възражение от друг екип, а всеки от ръководителите, които го одобряват, да може да спре обучението.

Визуалът е генериран код-арт, без чужди изображения.
Официални първоизточници
→OpenAI: обновената Preparedness Framework (април 2025)→Anthropic: Responsible Scaling Policy→OpenAI: Path to Astra→OpenAI: Towards safety cases for frontier AI training→OpenAI: Jakub Pachocki, An Alien Mind