Вышла DeepSeek V4.1-Flash: дешёвая модель для агентов с миллионом токенов контекста
10 сентября 2026 года DeepSeek выложила V4.1-Flash. Вход текстом и картинками, миллион токенов контекста, 15 центов за миллион на входе. Разбираем, как подставить её в свой агент и что при этом ломается.
10 сентября 2026 года DeepSeek выложила V4.1-Flash. На вход модель принимает и текст, и картинки, веса открыты по лицензии MIT.
Практический смысл в другом. У DeepSeek есть адрес, который отвечает в формате Anthropic, - агент, который у вас уже стоит, переключается на эту модель двумя строчками в настройках: адрес сервера и ключ. Код переписывать не надо.
Что это
Карточка модели - huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash, выложена 10 сентября 2026 года. В запросе модель называется deepseek-flash, контекст - миллион токенов, ответ - до 384 тысяч.
Локально её не поднять: файлы весов занимают около 510 ГБ. Открытая лицензия тут ничего не меняет, на практике это API и только API.
Чем лучше того, что было
По собственной таблице DeepSeek на агентских задачах модель встала вровень с Opus 5: DeepSWE v1.1 - 74,2 против 74,0, Terminal-Bench 2.1 - 90,6 против 89,1. Замеряла компания сама, независимых проверок пока нет.
В той же таблице DeepSeek показала и провал: Terminal-Bench 3.0 - 30,0 против 43,3 у Opus 5, Terminal-Bench 4.0 - 31,2 против 51,8. На длинных задачах в терминале разрыв почти двукратный.
Свои лучшие цифры DeepSeek получила на собственной обвязке. Под Claude Code та же модель на тех же двух тестах даёт 69,8 и 88,0 - подставить её вместо Opus и получить числа из первой строки не выйдет.
Как проверить за пятнадцать минут
Заведите ключ на platform.deepseek.com и пополните баланс. Бесплатного тарифа нет, DeepSeek списывает деньги с внесённой суммы - без пополнения первый же запрос вернёт ошибку.
Запускайте после 13:00 по Москве. По будням с 04:00 до 07:00 и с 09:00 до 13:00 действует пиковая цена, ровно вдвое выше. Выходные целиком идут по дешёвой ставке.
Возьмите задачу на чтение, а не на письмо. Длинный документ или переписку и одну просьбу: выписать оттуда даты и суммы. Модель построена под дешёвый разбор длинного ввода, разница в счёте видна здесь.
Сравните с тем, чем вы это делаете сейчас. Тот же текст, та же просьба. Смотреть надо не на гладкость ответа, а на то, сколько фактов модель пропустила.
Проверьте свои настройки на старое имя. Команда
grep -r "deepseek-v4" .в папке проекта покажет места, где прибитоdeepseek-v4-flash. Имя ещё принимается, но отвечает по нему уже V4.1-Flash.
curl https://api.deepseek.com/anthropic/v1/messages \
-H "x-api-key: $DEEPSEEK_API_KEY" \
-H "content-type: application/json" \
-d '{
"model": "deepseek-flash",
"max_tokens": 1024,
"messages": [
{ "role": "user", "content": "Прочитай текст ниже и выпиши списком все даты и суммы.\n\n<сюда текст>" }
]
}'Сколько стоит
Вход - $0,15 за миллион токенов в непиковые часы и $0,30 в пиковые. Выход - $0,60 и $1,20 за миллион. Текст, который уже был в предыдущем запросе, читается по $0,003 и $0,006: кэш включён по умолчанию.
Расчёт по этим ставкам, не замер по счёту. Запрос, где модель прочитала 2 миллиона токенов и написала 100 тысяч, в непиковые часы стоит 2 × $0,15 + 0,1 × $0,60 = 36 центов. Второй заход по тем же файлам, из кэша: 2 × $0,003 + 0,1 × $0,60 = 6,6 цента.
Старые имена deepseek-v4-flash и deepseek-v4-flash-vision-exp сняты, но запросы по ним по-прежнему принимаются - отвечает уже V4.1-Flash. Ошибки не будет, счёт даже уменьшится: раньше вход по этим именам стоил $0,22 за миллион, теперь $0,15. Поменяется модель.
Пример подмены: посылаете claude-opus-4-5, а отвечает не он. Всё, что начинается на claude-opus, DeepSeek уводит на deepseek-v4-pro, а claude-sonnet и claude-haiku - на deepseek-flash. Незнакомое имя уедет туда же: ответ придёт нормальный, подмену клиент не заметит.
С 14 сентября 2026 года, 12:00 по Пекину, deepseek-v4-pro перестаёт быть отдельной моделью: все запросы к нему уйдут на V4.1-Flash. Это 552 миллиарда параметров вместо 1,6 триллиона.
MCP-серверы через этот адрес не работают. Поле mcp_servers в документации помечено как игнорируемое: подключённые к агенту инструменты просто исчезнут, и агент об этом не сообщит.
Заменой основной модели для работы с кодом это не выглядит: на длинных задачах в терминале разрыв почти двукратный, и показывает его сама DeepSeek. А на механике - прочитать сотню страниц, разобрать выгрузку, снять цифры со скриншота - счёт выходит совсем другого порядка.
Прогоните на своей задаче и напишите, где она сломалась: на длине или на инструментах?