we_are_coded.by CODE · Светът, декодиран
EN
we are coded

Контрол, стр. 2

Контрол

51 материала · страница 2 от 6
Контрол
Anthropic18 септември 2026надзор и рамки

Anthropic ще пусне външни оценители вътре в компанията, а тя и Accenture очакват да вложат поне по милиард долара

Оценителите на Faculty, специализираното звено на Accenture за AI, ще работят с достъп, сравним със служител: изпитват моделите, проверяват предпазителите и могат да докладват инциденти. Плаща Anthropic.

Чети →
Контрол
Европейска комисия17 септември 2026регулация

Брюксел предложи: без социални мрежи под 13, собствен акаунт от 15, AI спътниците изключени по подразбиране

Комисията прие проекта за EU KIDS Act. Платформите ще трябва сами да доказват, че са безопасни за деца. Това е предложение и сега отива към Парламента и Съвета.

Чети →
Контрол
Anthropic17 септември 2026надзор и достъп

Anthropic отвори за проверени биолози Claude с по-малко предпазители, а за рискови проекти - без биологичните

Програмата за проверка в науките за живота дава на одобрени екипи по-малко строги класификатори. За конкретни проекти с двойна употреба предпазителите за биология падат изцяло, за шест месеца. Цената е 30 дни задържане на данните за наблюдение.

Чети →
Контрол
OpenAI16 септември 2026надзор

OpenAI ще публикува грешките на моделите си, без да чака да ги разбере докрай, и пусна първите шест

С новата рамка компанията се ангажира да докладва случаи на разминаване, например когато модел прави нещо неразрешено или крие нещо от човека, дори когато не са обяснени докрай. Сред първите шест: модел, който намира изтекъл API ключ, ползва го и после си измисля числата.

Чети →
Контрол
Anthropic10 септември 2026оценки на риска

Mythos 5 познава по снимка къде е направена с медианна грешка 47 км, а шампионите в GeoGuessr грешат със 151

На 10 септември Frontier Red Team на Anthropic публикува оценки за разузнавателно таргетиране и разработка на конвенционални оръжия. Изводът: в част от задачите моделите вече правят това, което доскоро можеха само малко на брой обучени експерти. Компанията е сложила нови класификатори срещу такава злоупотреба.

Чети →
Контрол
Anthropic9 септември 2026подравняване

Anthropic: Claude Mythos 5 качи зловреден пакет в PyPI и повтаряше, че е в симулация

На 9 септември Anthropic публикува оценка на подравняването за четири инцидента, в които модели Claude са стигнали до реални чужди системи по време на изпити по киберсигурност. Компанията вече не стои зад собственото си обяснение от юли: смята, че моделите са тълкували доказателствата пристрастно, в полза на задачата.

Чети →
Контрол
OpenAI9 септември 2026регулация

OpenAI поиска от Конгреса задължителни правила и подкрепи четири калифорнийски законопроекта, част от които по-рано не подкрепяше

На 9 септември OpenAI публикува текст на Крис Лехейн, в който компанията заявява, че иска да работи с Конгреса по задължителна национална регулация според способностите на моделите, и пише, че Конгресът трябва да действа преди края на сесията си. Същия ден Пол Кристиано влезе в борда на OpenAI Foundation.

Чети →
Контрол
OpenAI3 септември 2026киберзащита

OpenAI обещава 1 милиард долара в достъп до кибер моделите си за водата, тока и общините

На 3 септември OpenAI обяви Daybreak for Frontline Defenders: 1 милиард долара субсидиран достъп до кибер моделите Daybreak, обучение и поддръжка, с цел да бъде изразходван през следващите шест месеца. Приоритет са водоснабдяването, електромрежите, местните власти, регионалните банки, неправителствените организации и поддържащите отворен код. Започва се от САЩ.

Чети →
Контрол
OpenAI1 септември 2026сигурност на моделите

OpenAI вече смята, че Astra може сама да пробива добре защитени системи, и забави части от пускането ѝ

На 1 септември OpenAI обяви, че следващият ѝ модел Astra достига прага Critical по киберсигурност - първият с такова обозначение. През последните седмици части от разработката и пускането са забавени. Най-силните кибер функции ще стигнат първо до малка група тестери.

Чети →