惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

小众软件
小众软件
V
Visual Studio Blog
博客园 - 三生石上(FineUI控件)
Last Week in AI
Last Week in AI
Blog — PlanetScale
Blog — PlanetScale
爱范儿
爱范儿
J
Java Code Geeks
A
About on SuperTechFans
F
Fortinet All Blogs
B
Blog
aimingoo的专栏
aimingoo的专栏
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Engineering at Meta
Engineering at Meta
Y
Y Combinator Blog
有赞技术团队
有赞技术团队
G
Google Developers Blog
Apple Machine Learning Research
Apple Machine Learning Research
V
V2EX
博客园_首页
博客园 - 叶小钗
罗磊的独立博客
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
D
Docker
云风的 BLOG
云风的 BLOG

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Средние модели, большие надежды: испытываем гибридные LLM
Dmitriy_Khod · 2026-04-29 · via Все публикации подряд на Хабре

Уровень сложностиСредний

Время на прочтение3 мин

Охват и читатели258

Кейс

Привет, я Дмитрий, занимаюсь развитием LLMaaS. Перед нашей командой встала задача подбора «средней» языковой модели с примерно 9B параметров для обслуживания клиентских задач: оперативные чат-боты, саммаризация документов, генерация кода и аналитика на длинных контекстах. В таких сценариях критичны не только качество ответов, но и скорость, и стоимость инференса — ведь модель должна работать на одном GPU и при этом выдерживать заданный поток запросов.

Классические подходы — взять проверенную плотную модель вроде Llama 3.1 8B — дают неплохое качество, но упираются в память из-за тяжеловесного KV-кеша. Поэтому мы обратили внимание на гибридные архитектуры, где традиционное внимание чередуется с более экономичными механизмами: Mamba-2, Gated DeltaNet. Такие модели обещают радикально снизить расход памяти и увеличить пропускную способность без потери качества. Мы выделили три перспективные открытые модели этого класса: NVIDIA Nemotron-Nano 9B v2, Bamba-9B-v2 (IBM) и Qwen3.5 9B (Alibaba), и сравнили их с классической Llama 3.1 8B.

Моделирование проводилось для одного ускорителя NVIDIA H200 (141 ГБ) при типичной нагрузке: 4096 входных токенов, до 256 выходных. Рассчитывались метрики: Instance VRAM (память на один экземпляр с учётом весов, оверхеда и KV-кеша), E2E Latency, RPS с реплики, требуемый объём памяти на один RPS (VRAM/RPS), а также максимальная параллельность по памяти. Детальные расчёты и формулы мы ранее верифицировали с помощью собственного форка [InferSim](https://habr.com/ru/articles/1027358/) и публичных бенчмарков. Вот что получилось:

Метрики производительности моделей

Метрики производительности моделей

Почему у Nemotron такой микроскопический KV-кеш? Секрет — в архитектуре Nemotron-H. Модель построена не как классический Transformer, а как гибрид Mamba2, где 52 из 56 слоёв — это сверхбыстрые Mamba2-блоки, а полноценных Attention-слоёв, порождающих тяжёлый KV-кеш, всего четыре. Mamba2 работает как рекуррентная сеть: вместо того чтобы хранить раздувающуюся таблицу «ключей» и «значений» для каждого токена, она обновляет компактное скрытое состояние фиксированного размера. В результате весь KV-кеш для запроса из 4096 -> 256 токенов занимает 68 МБ — в 8 раз меньше, чем у Llama. Именно поэтому Nemotron способен держать в памяти почти 2000 одновременных запросов, упираясь уже не в память, а в вычислительную мощность GPU.

Почему Qwen3.5 тормозит на коротких контекстах? Архитектура Qwen3.5 построена вокруг Gated DeltaNet — механизма, который, как и Mamba2, оперирует фиксированным состоянием, а не растущим KV-кешем. Но у такого подхода есть своя цена. GDN-слои работают последовательно: для вычисления каждого нового токена им нужно обновить внутреннее состояние, и эта операция плохо параллелится на GPU. На коротких дистанциях, где классический Attention с его матричным умножением способен загрузить видеокарту почти на 100%, GDN-слои проигрывают в чистой скорости: TTFT у Qwen3.5 для 4096 токенов составляет 1.86 секунды против 1.32 секунды у Llama. Однако на дистанции 100K токенов маятник качается в другую сторону: там, где классический KV-кеш превращается в тормоз, Gated DeltaNet продолжает работать с той же эффективностью. Это классический компромисс «медленнее на коротких, быстрее на длинных».

Теперь о качестве. У каждой модели своя специализация. Nemotron-Nano 9B v2 — «математик»: AIME25 72.1%, MATH500 97.8% (лучший в классе), GPQA Diamond 64.0%, LiveCodeBench 71.1%. Qwen3.5 9B — «эрудит»: MMLU-Pro 82.5% (превосходит GPT-OSS-120B!), GPQA Diamond 81.7%, HMMT 83.2%. Bamba-9B-v2 — быстрый универсал, превосходящий Llama 3.1 8B по среднему баллу OpenLLM v2. С учётом скоростных характеристик выбор получается чётким. Для чат-ботов и потоковой обработки с высокой пропускной способностью нужен Nemotron — он в полтора раза быстрее Llama и примерно на 30% эффективнее использует память (VRAM/RPS 45.8 против 65.0 ГБ·с). Для саммаризации, аналитики документов и агентных систем, где во главе угла широкий кругозор и качество ответа, — Qwen3.5. Bamba занимает промежуточную позицию, обеспечивая заметный прирост скорости при сохранении привычного объема памяти.

LLM всё ещё потребляют много ускорителей, но прогресс архитектур (Mamba-2, Gated DeltaNet) позволяет шаг за шагом снижать стоимость владения: на одном H200 теперь можно обслуживать заметно больше клиентов, чем год назад. Выбор модели превращается в инженерную задачу с чёткими метриками, а не в гадание по маркетинговым обещаниям. Мы продолжаем калибровать наш симулятор и готовы делиться обновлёнными данными. Если у вас есть опыт промышленного развёртывания этих моделей — присоединяйтесь к обсуждению.