Институтът Allen показа преработена система за обучение на модели със смес от експерти. По данни на Ai2 на 8 чипа NVIDIA B300 модел с 47 милиарда параметри тренира 2.7 пъти по-бързо, отколкото със стария им код, а най-големият тест минава 1.2 трилиона параметри на 512 GPU. Пускат доклад, код и демо. Модели не.
- Експертите растат от 8 на 128 при около 3.2 милиарда активни параметри на токен; общият капацитет скача от 4.6 на 47 милиарда с под 5% загуба на скорост.
- Най-големият пробег: 1.2 трилиона параметри (58.36 милиарда активни) на 512 GPU, връх 858 TFLOP/s на чип. С DeepEP v2 стигат 2.38 трилиона.
- Пуснати са технически доклад, код в GitHub и демо. Чекпойнти в поста няма. Кодът в хранилището allenai/Olmo-core е под Apache 2.0.
52 000 срещу 19 400. Токени в секунда на един чип, същият модел, същият хардуер, нов код. Останалото в поста на Ai2 е как са стигнали дотам.
Внимавай какво е това и какво не е. Нов модел няма. Никой днес не тегли нов Olmo. Това е инструментът, с който се прави модел, и идва от екип, който досега публикуваше и данните, и кода, и теглата заедно.
Това е работата зад сцената, както на всяко събитие: ток, кабели и графика, които публиката не вижда. Мрежата между 512 чипа е точно тоя вид работа. Когато 128 експерта трябва да си разменят токени по хиляди връзки, губиш време в чакане, не в смятане. Ai2 твърди, че при скока от 8 на 128 експерта губи под 5% скорост. Тяхно число, тяхни тестове.
За кого е? За университети и малки лаборатории, които имат чипове, но нямат сто инженери да напишат такъв код. Досега избираха между затворения код на големите и собствен, който не мащабира. Сега има трети път, и е безплатен.
Проверката е проста. Ще се види, когато някой извън Ai2 обучи с него модел и го пусне. Дотогава е добър код с добър доклад.