Ai2 публикува модела и данните за обучението му. От изследователски въпрос и извадки от литературата AstaBrief пише доклад с цитати и в Asta работи като Fast режим до Thinking режима с Claude. Ai2 сама казва, че обучението и оценката са правени главно през 2025 и че пълната оценка не е повторена срещу днешните водещи модели.
- AstaBrief 8B тръгва от Qwen3-8B и пише целия доклад наведнъж, не секция по секция. По данни на Ai2 така докладът в Asta излиза около 3.5 пъти по-бързо, отколкото в Thinking режима с Claude.
- Образците за основното обучение са писани от затворени модели като Claude, o3 и GPT-4.1. Най-полезен е бил един прост филтър: колко от твърденията в доклада имат цитат.
- Човешкото проучване е малко: 14 въпроса, трима учени. Общото предпочитание печели DR-Tulu; по точност на цитатите двама от тримата избират AstaBrief.
51 секунди за един доклад с цитати. Толкова е средното време в Asta, по данни на Ai2, когато пише малкият им модел вместо режима с Claude, който иска почти три минути. Постът обаче е по-интересен от числото.
Погледни от кого се учи. Докладите-образци за основното обучение са писани от затворени модели: Claude, o3, GPT-4.1. Малкият отворен модел е ученик на големите. Отворени са моделът и данните. Учителите му не са. Ai2 го пише открито, а ти го чети заедно със скоростта.
Скоростта е лесната част. Трудна е верността. Постът казва сам, че цитат до изречение още не значи вярно изречение: модел може да посочи точното проучване и пак да твърди повече, отколкото то показва. Извадка от една група става правило за всички, минало време става сегашно, а описанието на един резултат се превръща в съвет какво да правят лекари, политици или изследователи.
Ai2 признава дупката в собствената си мерка. Мерили са главно релевантност, покритие и дали цитатите подкрепят твърденията. Дали твърдението е останало в обхвата на източника, засега не мерят и го водят сред следващите задачи.
Най-полезното в поста е скромно. Опитали са четири филтъра за слабите учебни примери и най-много е помогнал един прост: да се махнат докладите, в които малко от твърденията имат цитат. По-агресивното филтриране и комбинациите не са дали съществено повече. Ai2 го казва като урок: специализацията не е непременно въпрос на повече научен текст; много зависи от това дали примерите за обучение показват поведението.
Сравненията са на Ai2 и са правени главно през 2025. В проучването с учените общо предпочитание печели друг модел, а въпросите са само 14.
Има и реална полза: институция, чийто въпрос е чувствителен или още непубликуван, може да пусне AstaBrief на свои машини, зад своята защитна стена, без чужд API. Пуснеш ли го върху свои PDF файлове, отваряй цитатите един по един.