Для обычной рабочей станции разумнее начать с Qwen3.8-27B. Это плотная модель на 27B параметров; официальный репозиторий BF16 занимает около 55,6 ГБ, а официальный FP8 — 30,9 ГБ. Базовый репозиторий помечен лицензией Apache-2.0. Такой вариант проще вместить, измерить и поддерживать.
Qwen3.8-Flash-Next стоит ставить первым в очередь на тест, если важнее сложные задачи программирования и агентов, а система может держать гораздо больший набор весов. По карточке Qwen это разреженная MoE-модель: 125B параметров языковой части, 6B активируются на токен, отдельно указаны 51B n-gram embeddings и 4B MTP. Проверенная ревизия официального BF16-репозитория занимала около 360 ГБ. Поэтому A6B описывает активные вычисления, а не размер загрузки.
Короткое правило: 27B выбирают ради реальной вместимости, простой схемы плотной модели и предсказуемой эксплуатации. Flash-Next проверяют ради потенциально более высокого процента завершённых сложных задач. Менять модель по умолчанию следует только после одинакового теста на собственной нагрузке.
Сравнение без ловушки «активно только 6B»
| Фактор | Flash-Next | 27B |
|---|---|---|
| Архитектура | 125B разреженная MoE, активно 6B | 27B плотная модель |
| Дополнительные блоки | 51B n-gram embeddings, 4B MTP | MTP, без указанного 51B n-gram блока |
| Нативный контекст | 262 144 | 262 144 |
| Официальные BF16-артефакты | около 360 ГБ в проверенной ревизии | около 55,6 ГБ |
| Официальный FP8 | проверяйте точный текущий релиз | 30,9 ГБ |
| Лицензия | Qwen Community License 1.0 | Apache-2.0 |
| Статус | экспериментальная предварительная версия архитектуры Qwen4 | компактная плотная модель Qwen3.8 |
Источники этих строк — официальные карточки Qwen3.8-Flash-Next и Qwen3.8-27B. Размер файлов не равен пиковому RAM или VRAM. К весам добавляются KV-кэш, служебная память среды, изображения, пакетная обработка и параллельные запросы. Квантизация уменьшает объём, но одновременно меняет весь оцениваемый набор компонентов.
Разреженная маршрутизация выбирает часть экспертов для каждого токена и может снизить вычисления. Она не отменяет необходимость иметь доступ ко всему большому набору весов. У Flash-Next есть и крупный n-gram embedding block. Если модель работает через CPU offload, ограничением может оказаться уже пропускная способность памяти, а не число активных параметров.

Почему официальная таблица не даёт готового победителя
В своей общей таблице Qwen ставит Flash-Next выше 27B по большинству опубликованных строк. Например, DeepSWE 1.1 — 58,7 против 42,2, JobBench — 55,7 против 33,4. Но SWE-bench Pro показывает гораздо меньшую разницу: 62,5 против 61,7. Flash-Next также лидирует в ряде тестов многоязычного программирования, использования инструментов и мультимодальности.
Это весомая причина протестировать Flash-Next для длинных агентных циклов. Но это оценка производителя. В примечаниях к тестам указаны разные среды оценки, температура, контекст 256K, исправленные задания, внутренние наборы и модели-судьи. Некоторые значения выбраны как лучший результат из нескольких сред.
На вашей машине результат может измениться из-за GGUF- или FP8-сборки, шаблона запроса, версии среды выполнения, выгрузки в оперативную память и ограничений инструментов. Официальная таблица формирует гипотезу; решение формирует принятая работа.
Когда выигрывает 27B
27B лучше как первый вариант, если модель должна поместиться на одной машине без агрессивной выгрузки; если нужна понятная модель ёмкости для плотной архитектуры; если Apache-2.0 упрощает проверку продукта; если важны стабильная интерактивная задержка и быстрое восстановление; если уже проверена конкретная квантизация 27B.
Это не слабый запасной вариант. Qwen описывает 27B как нативную модель для текста, изображений и видео, рассчитанную на программирование, исследования, профессиональную работу и длительные агентные задачи. На части официальных тестов разрыв мал. Для обычного анализа документов, локальных правок кода, суммаризации и визуальных задач стоимость более тяжёлой предварительной версии может не окупиться.
Особенно осторожно сравнивайте широкий quant 27B с сильно сжатым Flash-Next. Потеря качества от квантизации и задержка offload могут перекрыть архитектурное преимущество.
Когда Flash-Next оправдывает инфраструктуру
Flash-Next интереснее там, где одна пропущенная инструкция приводит к дорогому повтору: правки нескольких файлов, длинные цепочки инструментов, восстановление приложения, профессиональные процессы, многоязычная разработка и мультимодальные агенты. Qwen связывает новый результат с разреженным вниманием, управляемыми остаточными связями, n-gram embeddings и новой схемой обучения — это реальный архитектурный эксперимент, а не переименование 27B.
Одновременно это предварительная версия. Поддержка архитектуры, MTP, видео и управления глубиной рассуждений появляется в средах выполнения с разной скоростью. Проверяйте точную версию vLLM, SGLang, TokenSpeed, llama.cpp или другого сервера до скачивания большого набора весов. Быстрая генерация на одной сборке не гарантирует быструю обработку запроса или стабильный длинный контекст на другой.
Лицензия — часть технического решения
Flash-Next опубликован под Qwen Community License 1.0. Она разрешает широкий спектр использования, изменения, распространения, хостинга и fine-tuning, но содержит существенные условия. Для крупных коммерческих продуктов выше указанных в тексте порогов действует требование отображать имя модели. Коммерческие Model as a Service и AI Work Assistant, как они определены в лицензии, должны получить отдельную лицензию Qwen. Для закрытого внутреннего использования описано исключение при отсутствии доступа третьих лиц к модели, output или capabilities.
Репозиторий 27B помечен Apache-2.0. Если вы строите API, помощника программиста или офисного помощника, сначала разберите лицензионные требования, а затем инвестируйте в интеграцию. Это не юридическая консультация: решение требует текущего полного текста и фактов вашего продукта.
Hosted Flash — другой контракт
Qwen/Qwen3.8-Flash-Next — веса для самостоятельного запуска. Облачный qwen3.8-flash создан на основе Flash-Next, но включает тарифы поставщика, ограничения скорости, встроенные инструменты и сервисные функции. Нельзя переносить цену или доступность API на локальные веса, а результат сторонней квантизации — на официальный облачный endpoint.
Если инфраструктура Flash-Next слишком тяжела, облачную модель можно проверить как отдельную альтернативу. Если приоритет — приватность, контроль весов и собственной квантизации, оставайтесь в сравнении самостоятельного запуска.
Тест перехода на одинаковых задачах
Выберите 6–10 задач с наблюдаемым результатом: исправление небольшой ошибки, рефакторинг нескольких файлов, работа с инструментами, анализ изображения, длинный документ и обычная инструкция. Для обеих моделей оставьте одинаковыми запрос, файлы, системные правила, предел контекста, инструменты и критерии проверки.

Записывайте не только tokens/s, но и принятый результат, проваленные тесты, потерянные ограничения, число повторов, ручные исправления, пиковую память, time to first token, полное время и восстановление после сбоя.
Сохраняйте 27B как модель по умолчанию, если дополнительные успешные задачи Flash-Next не покрывают память, выгрузку, лицензионную работу и время проверяющего. Продвигайте Flash-Next, если он стабильно уменьшает число повторов на дорогих задачах, а инфраструктура остаётся в бюджете. Разделение ролей тоже нормально: 27B для интерактивной работы, Flash-Next для очереди сложных задач.
При 16 ГБ VRAM сначала используйте отдельное руководство по выбору локальной LLM для программирования. Для более ранних веток Qwen пригодится карта Qwen3-30B-A3B.
Итог
Qwen3.8-27B — практичный первый выбор для ограниченной или ориентированной на стабильную эксплуатацию локальной системы. Flash-Next — амбициозный тест возможностей для большой памяти и задач, где качество работы агента снижает дорогую переделку.
Не позволяйте A6B считать память, оценке производителя — принимать работу, а словам «открытые веса» — заменять чтение лицензии. Победитель — тот полный набор компонентов, который проходит ваши задачи в заданном бюджете.



