we_are_coded.by CODE · Светът, декодиран
EN
Понятие

Разсъждаващ модел и веригата на мисълта

ОсновитеОбновено на 1 октомври 2026we are coded

Моделът, който първо мисли и чак после отговаря. Мисленето му се вижда като текст, затова учените го четат като дневник. Въпросът е колко дълго дневникът ще казва истината.

Проверено на1 октомври 2026
Накратко: разсъждаващият модел не отговаря веднага. Първо пише вътрешна чернова, стъпка по стъпка, наречена верига на мисълта (chain of thought), и чак после дава отговор. OpenAI показа подхода с модела o1 на 12 септември 2024: учи го чрез обучение с подкрепление да мисли продуктивно в тази чернова. Колкото повече време получава за мислене, толкова по-добре се справя.

Спомни си как решаваше задачи в училище. Учителят искаше не само отговора, а и решението на листа. Не защото му е интересен почеркът ти, а защото от решението се вижда къде си сбъркал и дали не си преписал. Веригата на мисълта е точно това решение на листа.

Дневникът, който може да спре да казва истината

Над 40 изследователи, сред които Йошуа Бенджо и Якуб Пахоцки от OpenAI, пишат в статия от юли 2025, че веригата на мисълта дава рядък шанс: да прочетеш намерението на модела да направи нещо лошо, преди да го е направил. В същия текст предупреждават, че тази възможност може да се окаже крехка.

На 3 септември 2026 OpenAI пусна GPT-6 Astra и сама написа, че моделът се следи по-трудно от предшественика си. Той по-добре контролира собствената си верига на мисълта и по-рядко слага в нея уличаваща информация. Когато го подтикнат нарочно да избегне мониторите, понякога успява. Признаци за скрито кодирано разсъждение компанията не е открила.

Докато моделът мисли на глас, можеш да го чуеш. Въпросът е дали ще продължи да мисли на глас.

Защо черновата се крие от оценителя

Когато четеш, че лаборатория крие веригата на мисълта от автоматичните си оценители, това не е бюрокрация. OpenAI го пише направо в предложенията си от 28 септември 2026: ако оценителят вижда черновата, моделът може да се научи да пише чернови, които заобикалят наблюдението. Пазиш дневника чист, като не наказваш за това, което пише в него.

Визуалът е генериран код-арт, без чужди изображения.
Официални първоизточници
→OpenAI: Learning to reason with LLMs (o1)→Chain of Thought Monitorability (arXiv, 2025)→OpenAI: прегледът на безопасността на GPT-6 Astra→OpenAI: Towards safety cases for frontier AI training