we_are_coded.by CODE · Светът, декодиран
EN
OpenAI

OpenAI пусна автоматичен нападател, който калява моделите ѝ

OpenAIФронтир

OpenAI представи GPT-Red - вътрешен инструмент, който автоматично атакува собствените ѝ модели (red-teaming) и подава наученото обратно в тренировката им. По данни на компанията новата версия постига чувствително по-малко пробиви при инжекция на заявки спрямо предшественика си отпреди месеци.

Накратко
  • OpenAI обяви GPT-Red - автоматизиран red-teamer, трениран със self-play, вграден в тренировъчния процес на бъдещи модели.
  • По данни на OpenAI постига около 6 пъти по-малко успешни пробиви при директна инжекция на заявки спрямо версия отпреди четири месеца.
  • Целта: сигурността да се калява автоматично и непрекъснато, вместо на ръка от хора при всеки нов модел.
Проверено на16 юли 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

Как каляваш модел срещу злоупотреба? Пускаш хора да го атакуват - т.нар. red-teaming - и запушваш дупките, които намерят. Бавно е и не мащабира. OpenAI обяви, че е автоматизирала самия нападател.

Фактите: на 15.07.2026 OpenAI представи GPT-Red - автоматизиран red-teamer, трениран със self-play, който атакува моделите ѝ и подава наученото обратно в тренировъчния им процес. По данни на OpenAI новата версия постига около 6 пъти по-малко успешни пробиви при директна инжекция на заявки (prompt injection) спрямо своя предшественик отпреди четири месеца. Числата са на компанията и не са независимо проверени. Източник: OpenAI, съобщение 'Unlocking Self-Improvement for Robustness'.

Красиво на хартия - и вероятно полезно наистина, но числото е на OpenAI и го приемам с обичайната резерва. По-интересна от '6 пъти' е идеята отдолу: защитата да се учи сама, в цикъл, вместо хора да я кърпят при всеки нов модел. Проработи ли, сигурността спира да е снимка отпреди пускането и става процес, който тече. Не проработи ли, е поредната автоматизация, която дава фалшиво спокойствие.

Автоматичният нападател срещу собствения модел е правилната посока - но точно защото е автоматичен, никой отвън не вижда какво пропуска. Затваряш кръга при себе си и молиш света да ти вярва на думата. Числото е добро; независимата проверка е това, което ще му даде тежест.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→OpenAI - Unlocking Self-Improvement for Robustness (GPT-Red)
Оригинал: https://wearecoded.com/articles/openai-gpt-red-self-improvement.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини