На 10 септември DeepSeek пусна V4.1-Flash - най-малкия модел от ново архитектурно семейство, с 552 милиарда параметъра и само 8 милиарда активни при четене на входа. От 14 септември всички заявки към V4-Pro се пренасочват към него по неговите цени. Теглата са под MIT.
- Каузален енкодер-декодер: 8 милиарда активни параметъра за входа, 16 за изхода.
- По данни на DeepSeek кешът за ключове и стойности иска една четвърт от паметта HBM и една осма от мястото на SSD спрямо предишното поколение.
- V4-Flash и V4-Flash-Vision-Exp са пенсионирани; новите цени важат от 10 септември, извън пика - 50% от пиковите.
DeepSeek V4-Pro изкара като общодостъпен модел четири седмици, преди компанията да обяви, че го извежда.
И не го сменя с по-голям. Сменя го с Flash, по-малкия и по-евтиния, който по техни данни го бие.
Защо входът и изходът имат различна цена
Агентите четат много повече, отколкото пишат. Цял файл, история на разговора, резултат от инструмент, после три реда отговор. Моделът, който харчи по-малко точно при четенето, е направен за тях.
DeepSeek пише направо защо: таксите за попадение в кеша често са голяма част от разходите на агента, и свиването на кеша ги сваля. Това е инженерство, водено от сметката, и на него вярвам повече, отколкото на бенчмарк.
Една бележка за числата. 552 милиарда е официалната цифра от съобщението. В картата на модела отделно стои условна памет от 196 милиарда параметъра, затова, ако броиш файловете в Hugging Face, ще стигнеш до повече. Грешка няма, просто се брои различно.
От 14 септември заявките ти към deepseek-v4-pro през API отиват при друг модел, без да си сменил ред код. Пусни своите тестове преди тази дата, не след нея.