we_are_coded.by CODE · Светът, декодиран
EN
DeepSeek

DeepSeek пусна V4.1-Flash и пенсионира собствения си флагман: заявките към V4-Pro отиват към по-малкия модел

DeepSeek API Docs · събитието: 10 септември 2026Фронтир

На 10 септември DeepSeek пусна V4.1-Flash - най-малкия модел от ново архитектурно семейство, с 552 милиарда параметъра и само 8 милиарда активни при четене на входа. От 14 септември всички заявки към V4-Pro се пренасочват към него по неговите цени. Теглата са под MIT.

Накратко
  • Каузален енкодер-декодер: 8 милиарда активни параметъра за входа, 16 за изхода.
  • По данни на DeepSeek кешът за ключове и стойности иска една четвърт от паметта HBM и една осма от мястото на SSD спрямо предишното поколение.
  • V4-Flash и V4-Flash-Vision-Exp са пенсионирани; новите цени важат от 10 септември, извън пика - 50% от пиковите.
Проверено на1 октомври 2026Отговорен редакторЦветелин ИвановКак работимМетод · Корекции

DeepSeek V4-Pro изкара като общодостъпен модел четири седмици, преди компанията да обяви, че го извежда.

И не го сменя с по-голям. Сменя го с Flash, по-малкия и по-евтиния, който по техни данни го бие.

Фактите: на 10 септември 2026 г. DeepSeek пусна DeepSeek-V4.1-Flash, най-малкия модел в ново архитектурно семейство, с вградено разбиране на изображения. По данни на компанията това е MoE модел с 552 милиарда параметъра и архитектура „каузален енкодер-декодер", при която активни са 8 милиарда параметъра при обработката на входа и 16 милиарда при генерирането. Спрямо предишното поколение кешът за ключове и стойности иска 1/4 от паметта HBM и 1/8 от мястото на SSD. DeepSeek пише, че тестове, правени от няколко различни участници, поставят V4.1-Flash пред V4-Pro по представяне, цена, скорост и общо време за изпълнение. V4-Flash и V4-Flash-Vision-Exp са пенсионирани, като старите имена временно водят към новия модел; от 04:00 UTC на 14 септември всички заявки към deepseek-v4-pro се пренасочват към V4.1-Flash по неговите цени, докато излезе V4.1-Pro. Новите цени важат от 04:00 UTC на 10 септември, като извън пиковите часове цената е 50% от пиковата. Теглата са в Hugging Face под лиценз MIT; картата на модела описва 552 милиарда параметъра в основната мрежа, отделна условна памет Engram от 196 милиарда параметъра и контекст до един милион токена.

Защо входът и изходът имат различна цена

Агентите четат много повече, отколкото пишат. Цял файл, история на разговора, резултат от инструмент, после три реда отговор. Моделът, който харчи по-малко точно при четенето, е направен за тях.

DeepSeek пише направо защо: таксите за попадение в кеша често са голяма част от разходите на агента, и свиването на кеша ги сваля. Това е инженерство, водено от сметката, и на него вярвам повече, отколкото на бенчмарк.

Моделът е направен за агента, който чете сто реда, за да напише три.

Една бележка за числата. 552 милиарда е официалната цифра от съобщението. В картата на модела отделно стои условна памет от 196 милиарда параметъра, затова, ако броиш файловете в Hugging Face, ще стигнеш до повече. Грешка няма, просто се брои различно.

От 14 септември заявките ти към deepseek-v4-pro през API отиват при друг модел, без да си сменил ред код. Пусни своите тестове преди тази дата, не след нея.

Визуалът към статията е генериран код-арт, без чужди изображения.
Последвай ниFacebookLinkedIn
Официални първоизточници
→DeepSeek API Docs - DeepSeek-V4.1-Flash Release, 10.09.2026→Hugging Face - deepseek-ai/DeepSeek-V4.1-Flash (карта на модела и лиценз)
Оригинал: https://wearecoded.com/articles/deepseek-v41-flash-zamenya-v4-pro.html
СподелиFacebookXLinkedInTelegramWhatsApp
← Обратно към всички новини