we_are_coded.by CODE · Светът, декодиран
EN
Ai2

Ai2 пусна Olmo-core 3: отворен код за обучение на MoE модели до трилион параметри

Ai2Фронтир

Институтът Allen показа преработена система за обучение на модели със смес от експерти. По данни на Ai2 на 8 чипа NVIDIA B300 модел с 47 милиарда параметри тренира 2.7 пъти по-бързо, отколкото със стария им код, а най-големият тест минава 1.2 трилиона параметри на 512 GPU. Пускат доклад, код и демо. Модели не.

Накратко
  • Експертите растат от 8 на 128 при около 3.2 милиарда активни параметри на токен; общият капацитет скача от 4.6 на 47 милиарда с под 5% загуба на скорост.
  • Най-големият пробег: 1.2 трилиона параметри (58.36 милиарда активни) на 512 GPU, връх 858 TFLOP/s на чип. С DeepEP v2 стигат 2.38 трилиона.
  • Пуснати са технически доклад, код в GitHub и демо. Чекпойнти в поста няма. Кодът в хранилището allenai/Olmo-core е под Apache 2.0.
Проверено на2 октомври 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

52 000 срещу 19 400. Токени в секунда на един чип, същият модел, същият хардуер, нов код. Останалото в поста на Ai2 е как са стигнали дотам.

Фактите: на 1 октомври 2026 г. Ai2 (Allen Institute for AI) публикува Olmo-core 3, отворена система за обучение на големи модели със смес от експерти (MoE). По данни на Ai2 броят на експертите расте от 8 на 128 при около 3.2 милиарда активни параметри на токен, а общият капацитет се вдига от 4.6 на 47 милиарда параметри със спад на пропускателността под 5%. В предварителен тест на 8 чипа NVIDIA B300 модел с 47 милиарда параметри прави 52 000 токена в секунда на GPU срещу 19 400 със старата им реализация, около 2.7 пъти повече. Най-големият тест е 1.2 трилиона общо параметри (58.36 милиарда активни на токен) на 512 GPU, с връх 858 TFLOP/s на чип (тестове със случайно маршрутизиране, за скоростта на системата, не за качество на модел); с DeepEP v2 системата е изпробвана до 2.38 трилиона параметри. Пуснати са технически доклад, кодът в GitHub и интерактивно демо. Обучени модели или чекпойнти постът не споменава. Кодът в хранилището allenai/Olmo-core е под лиценз Apache 2.0.

Внимавай какво е това и какво не е. Нов модел няма. Никой днес не тегли нов Olmo. Това е инструментът, с който се прави модел, и идва от екип, който досега публикуваше и данните, и кода, и теглата заедно.

Това е работата зад сцената, както на всяко събитие: ток, кабели и графика, които публиката не вижда. Мрежата между 512 чипа е точно тоя вид работа. Когато 128 експерта трябва да си разменят токени по хиляди връзки, губиш време в чакане, не в смятане. Ai2 твърди, че при скока от 8 на 128 експерта губи под 5% скорост. Тяхно число, тяхни тестове.

Моделът е сцената. Това е тонът и светлините.

За кого е? За университети и малки лаборатории, които имат чипове, но нямат сто инженери да напишат такъв код. Досега избираха между затворения код на големите и собствен, който не мащабира. Сега има трети път, и е безплатен.

Проверката е проста. Ще се види, когато някой извън Ai2 обучи с него модел и го пусне. Дотогава е добър код с добър доклад.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→Ai2 - Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs, 01.10.2026→Ai2 - Olmo-core (GitHub, Apache 2.0), 01.10.2026
Оригинал: https://wearecoded.com/articles/ai2-olmo-core-3-moe.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини