we_are_coded.by CODE · Светът, декодиран
EN
Google DeepMind

Google пусна външни да изпитат Gemini, без да им покаже модела и без да види въпросите им

Google DeepMind · събитието: 27 август 2026Контрол

На 27 август DeepMind обяви първата двойно-сляпа оценка на собствен челен модел. Въпросите на проверяващите и теглата на модела се срещат в криптографска кутия, в която нито едната страна не вижда другата. Проблемът, който се опитват да решат, е стар и досаден: моделът вече е виждал изпита.

Накратко
  • Досега външната проверка искаше жертва: или оценителят дава въпросите си, или лабораторията дава теглата си.
  • Пилотът върви върху Gemini Flash Lite, в Confidential Space на Google Cloud, с четирима външни партньора.
  • Смисълът е един - резултатът от изпита да значи нещо, когато го чете регулатор или купувач.
Проверено на28 август 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

Представи си ученик, който е видял въпросите предната вечер. Шестицата му е истинска само на хартия.

Точно това е положението с класациите на моделите от години. Наричат го замърсяване на теста: моделът е срещал задачите някъде в обучението си, изкарва висок резултат и никой не може да каже колко от него е знание и колко е спомен. Всички го знаят, а малцина правят нещо по въпроса, защото решението дълго време изискваше едната страна да се разголи пред другата.

Тук е новото. Никой не ги сваля.

Фактите: на 27 август 2026 г. Google DeepMind обяви пилот на първата двойно-сляпа оценка на собственически модел от челен клас. Тестван е модел от семейството Gemini Flash Lite срещу поверителни набори от задачи. Партньорите са Singapore AI Safety Institute, OpenMined, AVERI и MLCommons. Технически оценката тече в Confidential Space - част от портфолиото за поверителни изчисления на Google Cloud - където криптографски се доказва, че оценяващият не вижда теглата на модела, а Google не вижда задачите на оценяващия. По думите на авторите досегашната практика е разчитала на договорни гаранции и на протоколи без запис на заявките, а тук за пръв път се добавя техническа пречка. Публикуван е и отделен технически доклад с методиката и резултатите. Авторите на съобщението са William Isaac, Sol Messing и Kristian Lum.

Защо досега не се е правило

Защото сделката беше лоша и за двамата. Външният оценител трябваше да предаде въпросите си на лабораторията, която утре тренира следващия модел - и тогава наборът му става безполезен завинаги. Или лабораторията трябваше да предаде теглата си на външен екип, което никой не прави с продукт за милиарди.

Затова проверките дълго време бяха въпрос на доверие и подпис. Работеше, докато залогът беше класация. Не работи, когато на другия край стои държавен орган, който трябва да каже дали този модел може да влезе в критична система.

Доверието е добро. Криптографията не се уморява.

Какво още не знаем

Пилотът е върху Flash Lite - малкият модел от семейството, не най-тежкият. Разбираемо е за първи пробег, но значи, че истинският тест на подхода още предстои: същата кутия, същите гаранции, върху модела, за който хората наистина спорят.

И второто, което липсва в съобщението: цената. Поверителните изчисления не са безплатни и не са бързи. Ако една такава оценка струва десет пъти повече от обикновената, тя ще се прави за регулатора и няма да се прави за никой друг.

Пиша го без ирония - това е добър ход и от правилната посока. Просто следващият интересен документ по темата ще е сметката под него, а нея още никой не я е показал.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→Google DeepMind - Piloting the world's first double-blind AI evaluations, 27.08.2026
Оригинал: https://wearecoded.com/articles/deepmind-dvoyno-slepi-ocenki.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини