Перейти к содержанию
Разработка

DeepSeek V4.1 Flash: сравнение с GLM-5.3 Flash и GPT-5.6 Luna

10 сентября 2026 года DeepSeek выпустила DeepSeek V4.1 Flash — новую модель, ориентированную в том числе на работу AI-агентов и разработку ПО.

К результатам моделей в первые сутки после релиза стоит относиться осторожно: производитель показывает лучшие бенчмарки, а в социальных сетях чаще пишут пользователи, получившие особенно удачный результат.

Тем не менее V4.1 Flash заметно отличается от предыдущего Flash. DeepSeek представила новую архитектуру, добавила полноценную работу с изображениями, расширила возможности agentic coding и оптимизировала работу с большим контекстом.

Что изменилось в DeepSeek V4.1 Flash

V4.1 Flash — мультимодальная MoE-модель с 552 млрд backbone-параметров и контекстом до 1 млн токенов.

Она построена на новой архитектуре Causal Encoder-Decoder. При обработке входного контекста активируется около 8 млрд параметров на токен, при генерации — около 16 млрд.

DeepSeek также существенно уменьшила объём KV-кэша — памяти, необходимой модели для хранения уже обработанного контекста.

В V4.1 Flash KV-кэш занимает примерно в четыре раза меньше места, чем в V4 Flash. Это снижает требования к памяти и стоимость работы с длинным контекстом.

Для coding agents это особенно полезно: агент может долго работать с одним репозиторием, повторно обращаться к коду, истории изменений, результатам команд и логам. Чем меньше памяти требуется для хранения такого контекста, тем эффективнее становится длинная агентная сессия.

Модель получила:

  • контекст до 1 млн токенов;

  • максимальный output до 384 тысяч токенов;

  • native vision;

  • tool calling;

  • Responses API;

  • Anthropic-compatible API;

  • управляемый reasoning_effort от 1 до 100.

В API модель называется:

deepseek-flash

Предыдущие API-названия V4 Flash пока продолжают приниматься, но запросы фактически обслуживаются V4.1 Flash.

Результаты в coding agents

Наиболее показательная часть опубликованных результатов — тесты, где AI самостоятельно работает с репозиторием, терминалом и инструментами.

По данным DeepSeek:

Benchmark

DeepSeek V4.1 Flash

GPT-5.6 Sol

GLM-5.3

Terminal-Bench 2.1

90,6

88,8

88,2

Terminal-Bench 3.0

30,0

34,4

28,3

Terminal-Bench 4.0

31,2

39,9

37,9

DeepSWE v1.1

74,2

73,0

66,9

NL2Repo-Bench

64,0

56,8

58,0

AutomationBench

54,8

45,8

48,8

Agent's Last Exam

31,8

26,7

28,5

На части agentic-тестов V4.1 Flash оказывается выше GPT-5.6 Sol. В Terminal-Bench 3.0 и 4.0 Sol, наоборот, сохраняет преимущество.

GPT-5.6 Sol здесь приведён только потому, что DeepSeek использует его в своей сравнительной таблице. Это не означает, что V4.1 Flash и Sol относятся к одной ценовой категории или рассчитаны на одинаковый сценарий использования.

Есть ещё одна оговорка: результаты DeepSeek получены при reasoning_effort=100, то есть на максимальном уровне размышлений. Для большинства coding-agent benchmark также использовался собственный DeepSeek Harness.

Поэтому эти результаты стоит рассматривать как показатель потенциальных возможностей модели, а не как гарантию аналогичного результата в OpenCode, IDE или другом агенте.

Первые отзывы разработчиков

В обсуждениях первых суток чаще всего отмечают скорость и качество работы с крупными coding-задачами.

Есть отзывы о сложных backend- и low-level-задачах, работе с Python, тензорами и GGUF, а также об исправлении старых ошибок, которые другие модели ранее обходили стороной.

Это пользовательские кейсы, а не контролируемые тесты, поэтому делать из них количественные выводы нельзя. Но они позволяют оценить поведение модели в реальных agentic-сценариях.

Пользователи OpenCode также часто отмечают высокую скорость V4.1 Flash. При этом первые отзывы не указывают на очевидное падение качества ради ускорения.

DeepSeek V4.1 Flash против GLM-5.3 Flash

Для недорогого AI-кодинга это сейчас одно из наиболее практичных сравнений.

GLM-5.3 Flash уже успел закрепиться как удобный вариант для постоянной работы coding agent: достаточно хорошее качество, высокая скорость и низкая стоимость.

Первые пользователи V4.1 Flash часто ставят новый DeepSeek как минимум рядом с GLM-5.3 Flash, а некоторые оценивают его ближе к полноценному GLM-5.3.

При этом модели ведут себя по-разному.

DeepSeek V4.1 Flash чаще самостоятельно исследует репозиторий и пытается найти корневую причину проблемы.

GLM-5.3 Flash по первым отзывам может быть удобнее для небольших локальных изменений, когда от агента требуется минимально затронуть существующий код.

Предварительно сравнение выглядит так:

Задача

Предварительный выбор

Быстрая повседневная разработка

DeepSeek V4.1 Flash / GLM-5.3 Flash

Длинная agentic-задача

DeepSeek V4.1 Flash

Исследование большого репозитория

DeepSeek V4.1 Flash

Маленький локальный patch

GLM-5.3 Flash может быть удобнее

Независимый review

GLM-5.3 Flash

Цена/качество

обе модели выглядят очень сильными

После одного дня использования считать этот порядок окончательным нельзя.

А что с GPT-5.6 Luna

Если Sol в этой статье появляется из-за официальных benchmark DeepSeek, то GPT-5.6 Luna интереснее как практический конкурент V4.1 Flash в роли быстрой и относительно недорогой модели для ежедневной разработки.

Но это сравнение пока в основном теоретическое.

Полноценного независимого теста DeepSeek V4.1 Flash и GPT-5.6 Luna в одинаковом coding-agent окружении пока нет. Поэтому утверждать, что одна из моделей уже объективно лучше другой именно в программировании, рано.

По характеристикам и API-тарифам сравнение выглядит так:

DeepSeek V4.1 Flash

GPT-5.6 Luna

Контекст

1M

1,05M

Max output

384K

128K

API input

$0,15 off-peak / $0,30 peak

$0,20

Cached input

$0,003 / $0,006

$0,02

Output

$0,60 / $1,20

$1,20

Native vision

Да

Да

Tool calling

Да

Да

Для coding agents особенно заметна стоимость cached input.

Агент регулярно повторно использует части репозитория, инструкции и историю предыдущих действий. При длинной сессии cached input может составлять существенную долю общего трафика.

У DeepSeek V4.1 Flash он стоит:

$0,003–0,006 за 1 млн токенов

против:

$0,02 за 1 млн токенов

у GPT-5.6 Luna.

При больших объёмах повторно используемого контекста это даёт DeepSeek преимущество по стоимости.

Но без одинаковых практических тестов правильнее считать V4.1 Flash и Luna конкурентами в одном классе задач, а не пытаться заранее выбрать победителя.

OpenCode Go и текущая акция

Попробовать V4.1 Flash сейчас можно через OpenCode Go.

Подписка стоит $10 в месяц и предоставляет доступ сразу к нескольким coding-моделям.

Среди них:

  • DeepSeek V4.1 Flash;

  • GLM-5.3 Flash;

  • GPT-5.6 Luna;

  • GLM-5.3;

  • Grok 4.6;

  • MiniMax;

  • Qwen;

  • Kimi;

  • MiMo и другие.

Для DeepSeek V4.1 Flash сейчас действует временное увеличение лимитов ×4.

Стандартный лимит составляет примерно:

6 500 запросов за 5 часов
и $15 месячного usage.

На время акции:

около 26 000 запросов за 5 часов
и $60 месячного usage.

Стоимость подписки при этом остаётся $10 в месяц.

Эти $60 — не баланс счёта, а внутренний лимит потребления модели, рассчитанный по стоимости токенов.

Для активной работы coding agent текущая акция выглядит выгодно, если использовать заметную часть доступного лимита.

После окончания акции

Увеличение лимита V4.1 Flash временное.

После акции лимит должен вернуться к обычным $15 в месяц.

Для сравнения:

Модель

Примерно запросов / 5 ч

Месячный usage

GPT-5.6 Luna

2 050

$15

GLM-5.3 Flash

6 320

$60

DeepSeek V4.1 Flash

6 500

$15

DeepSeek V4.1 Flash — сейчас по акции

26 000

$60

После завершения акции GLM-5.3 Flash может оказаться выгоднее DeepSeek именно внутри OpenCode Go, поскольку его постоянный месячный лимит выше.

Сейчас же V4.1 Flash за $10 — один из самых доступных способов активно проверить новую модель на реальном проекте.

OpenCode Go позволяет сравнить DeepSeek и Luna на одном проекте

Наличие V4.1 Flash и GPT-5.6 Luna в одной подписке позволяет провести нормальный практический тест:

один agent → один repository → одинаковые задачи → DeepSeek V4.1 Flash vs GPT-5.6 Luna.

Например:

  1. небольшой bug fix;

  2. feature в нескольких файлах;

  3. анализ незнакомого legacy-кода;

  4. рефакторинг;

  5. написание тестов;

  6. поиск причины ошибки;

  7. большая автономная задача с запуском тестов.

Сравнивать стоит не только финальный код, но и время выполнения, количество tool calls, число переделок, расход токенов и объём лишних изменений.

Такой тест будет гораздо показательнее сравнения характеристик моделей на бумаге.

Склонность к лишним изменениям

У V4.1 Flash уже обнаружилась характерная особенность.

Некоторые пользователи OpenCode отмечают, что модель может переусложнять сравнительно простые задачи.

Вместо небольшого изменения в конкретном месте она начинает изучать соседний код, искать более фундаментальную причину проблемы и иногда предлагает более масштабную переделку.

Для задачи:

исследуй проблему и исправь её правильно

это может быть полезно.

Для задачи:

поменяй эти три строки и больше ничего не трогай

такое поведение уже мешает.

Поэтому часть разработчиков пока предпочитает GLM-5.3 Flash для небольших «хирургических» изменений.

Для V4.1 Flash имеет смысл подбирать уровень reasoning под задачу: максимальное значение требуется далеко не всегда, а для небольших изменений более умеренный режим может оказаться практичнее.

Стоимость прямого API

V4.1 Flash доступен и непосредственно через DeepSeek API.

Текущие цены:

Off-peak

Peak

Input, cache hit

$0,003

$0,006

Input, cache miss

$0,15

$0,30

Output

$0,60

$1,20

Все цены указаны за 1 млн токенов.

Для нерегулярной работы прямой API может оказаться дешевле подписки.

При интенсивном использовании coding agent текущая акция OpenCode Go за $10 выглядит выгоднее, если доступные лимиты действительно используются.

V4.1 Flash заменяет предыдущий V4 Pro

DeepSeek заявляет, что V4.1 Flash в совокупности превосходит предыдущий V4 Pro по производительности, стоимости, скорости и времени выполнения задач.

С 14 сентября 2026 года запросы к deepseek-v4-pro временно будут перенаправляться на V4.1 Flash и тарифицироваться по цене Flash — до выхода будущего V4.1 Pro.

Таким образом V4.1 Flash временно становится основной моделью текущего поколения DeepSeek.

Стоит ли переходить

После первых суток называть DeepSeek V4.1 Flash лучшей моделью для программирования преждевременно.

Но её уже можно рассматривать как одного из наиболее интересных кандидатов на роль основной недорогой модели для AI-разработки.

По первым бенчмаркам и отзывам V4.1 Flash способен конкурировать с более дорогими моделями в agentic coding, сохраняя низкую стоимость и высокую скорость.

Для практической работы сейчас можно рассматривать такую схему:

DeepSeek V4.1 Flash — основная разработка и длинные agent-задачи.

GLM-5.3 Flash — локальные изменения и независимый review.

GPT-5.6 Luna — альтернативный быстрый агент, который имеет смысл напрямую сравнить с DeepSeek на собственном проекте.

GPT-5.6 Sol — более дорогая frontier-модель для сложной архитектуры, критических решений и дополнительной проверки. В статье она фигурирует прежде всего как точка сравнения в официальных бенчмарках DeepSeek.

Во время текущей акции OpenCode Go за $10 позволяет проверить сразу несколько таких моделей в одном рабочем окружении.

Практический вопрос сейчас можно сформулировать так:

нужна ли дорогая frontier-модель для каждой задачи разработки?

Нужен сайт или приложение?

Обсудим ваш проект бесплатно

Оставить заявку

Мы используем файлы cookie для улучшения работы сайта. Продолжая пользоваться сайтом, вы соглашаетесь с их использованием.