惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
V2EX
Recent Announcements
Recent Announcements
博客园 - 司徒正美
P
Proofpoint News Feed
博客园 - 聂微东
小众软件
小众软件
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
aimingoo的专栏
aimingoo的专栏
量子位
MyScale Blog
MyScale Blog
云风的 BLOG
云风的 BLOG
博客园 - Franky
B
Blog RSS Feed
F
Full Disclosure
The Cloudflare Blog
宝玉的分享
宝玉的分享
Last Week in AI
Last Week in AI
D
DataBreaches.Net
N
News and Events Feed by Topic
S
Secure Thoughts
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
V2EX - 技术
V2EX - 技术
L
LINUX DO - 最新话题
H
Heimdal Security Blog
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Application and Cybersecurity Blog
Application and Cybersecurity Blog
Apple Machine Learning Research
Apple Machine Learning Research
L
LangChain Blog
Hugging Face - Blog
Hugging Face - Blog
C
Check Point Blog
U
Unit 42
G
Google Developers Blog
Forbes - Security
Forbes - Security
S
Schneier on Security
T
Threatpost
W
WeLiveSecurity
I
Intezer
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Security Latest
Security Latest
T
Troy Hunt's Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
I
InfoQ
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
有赞技术团队
有赞技术团队
S
Security Affairs
Cisco Talos Blog
Cisco Talos Blog
T
Tenable Blog
Simon Willison's Weblog
Simon Willison's Weblog
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
V
Vulnerabilities – Threatpost

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
Как за 30 000р дообучить модель, которая работает на уровне GPT-5.4 — на задачах российских учителей
daniel_ivano · 2026-04-22 · via Все публикации подряд на Хабре

Уровень сложностиСредний

Время на прочтение5 мин

Охват и читатели1.7K

Аналитика

Продолжение. В первой статье мы протестировали 30 нейросетей на задачах для российских учителей. Российские модели заняли последние места. Но строчка #9 — наша: дообученная модель за ~30 000₽, которая работает локально. Вот как мы её сделали.

Зачем вообще дообучать

В комментариях к первой статье справедливо спросили — почему российские модели плохи? GigaChat-2 Max набрал 2.39 из 4, YandexGPT 5.1 Pro — 2.51. Ответ простой: в обучающей выборке этих моделей мало российских школьных задач, они оптимизированы под чат, не под образовательную деятельность.

Та же проблема у GPT-5.4 — он набрал 3.2 из 4. Хорошо, но не лучший вариант, он знает, что такое урок, но не знает, как его правильно оформить по российскому стандарту.

Вторая причина практическая. По 152-ФЗ российские школы не могут использовать иностранные облачные модели для работы с данными учеников. Нужно что-то, что можно развернуть локально.

Выбор базовой модели

Мы выбрали Qwen3.5-27B — открытую модель от Alibaba.

Почему именно она:

Критерий

Qwen3.5-27B

Альтернативы

Архитектура

Dense (все 27B работают)

MoE-модели: активны только 3-22B

Языки

119, включая тюркскую группу

GigaChat — только русский

Развёртывание

Q6_K ~20GB → помещается на Mac Mini M4 Pro

70B+ — нужна серверная карта

Дообучение

QLoRA на 1 GPU за 17 часов

GPT-5.4 — вообще нельзя дообучить

Тюркские языки важны, потому что в бенчмарке есть Модуль D — ChuvashBench (чувашский язык, тюркская группа). Модель, которая видела турецкий и казахский, лучше отработает на чувашском.

Почему 27B победила 32B

Это было неожиданно. Мы параллельно обучили две модели:

Модель

Параметры

Время на H200

Training Loss

Итоговый скор

EduLLM-RU 27B (Qwen3.5)

27B

~6 ч

0.51

3.21

EduLLM-RU 32B (Qwen3)

32B

~16 ч

0.47

2.69

32B модель показала лучший training loss (ниже = лучше), но на реальных задачах проиграла на 0.52 пункта. Потратили на неё почти в 3 раза больше GPU-времени и получили результат хуже.

Причина: Qwen3.5 — более новая архитектура, чем Qwen3. Даже при меньшем количестве параметров она лучше работает с русским языком и структурированными задачами. Урок: архитектура важнее размера.

Данные: 30 000 рублей за 30 000 пар

Дообучение — это прежде всего данные. Нет хорошего открытого датасета для российского образования. Пришлось создавать с нуля.

Подход: CRAFT (Corpus Retrieval and Augmented Fine-Tuning, ACL 2025). Суть: берём реальные образовательные материалы как затравку → генерируем на их основе пары “запрос-ответ” с помощью сильных моделей.

Затравочные данные (все открытые):

  • MMLU-RU — 14K вопросов, 57 предметов

  • MERA — 80K+ задач (ruworldtree: 640 экзаменационных вопросов по классам)

  • gsm8k-ru — 8.7K математических задач

  • Параллельный чувашско-русский корпус — 1.46M пар

  • Технологические карты от учителей-пилотов (200+ планов)

  • EduBench-RU промпты (50 задач) как шаблоны

Генерация:

Задача

Модель-генератор

Объём

Стоимость

Образовательные пары (20 категорий)

Claude Sonnet 4.6 (Batch API)

20 000

$260

Чувашские пары (10 категорий)

Gemini 3.1 Pro (Batch API)

10 000

~$40

Итого

30 000

~$310

Batch API экономит ~50% стоимости. 20 000 образовательных пар сгенерировались за 40 минут при Tier 4 лимитах.

Фильтрация: Минимальная — дедупликация по сходству слов (Jaccard >0.85). Удалили 16 дубликатов из 30 000 (0.05%). Не использовали LLM-фильтр: фильтровать выходы Sonnet 4.6 (#5 в нашем бенчмарке) с помощью модели слабее — бессмысленно. Контроль качества — по итогам обучения, на бенчмарке.

GPU-время: Обучали на арендованном H200 (пример - Vast.ai, ~$3.80/час). QLoRA на 27B модели заняла ~6 часов.

Статья

Стоимость

Генерация данных (Anthropic + Google API)

$310

GPU-аренда (H200, 6 часов × $3.80)

~$23

Итого

~$330 (~30 000₽)

GPU-аренда — это ~7% бюджета. Основные расходы — генерация данных.

Обучение: QLoRA за 17 часов

QLoRA (Quantized Low-Rank Adaptation) — дообучаем не всю модель, а маленькие адаптеры поверх неё. Это позволяет обучить 27B модель на одной GPU.

Конфигурация:

  • Метод: QLoRA, rank 64, alpha 128

  • GPU: NVIDIA H200 (80GB HBM3e)

  • Время: ~6 часов (27B) / ~16 часов (32B)

  • Фреймворк: Unsloth (ускоряет обучение LoRA ~2×)

  • Формат данных: ShareGPT (conversation format)

  • Сплит: 28 484 train / 1 500 val (95/5)

Результат: строчка #9

EduLLM-RU 27B заняла 9 место из 30 моделей с баллом 3.21 из 4.

Для контекста — вот окружение:

#

Модель

Балл

Тип

8

Kimi K2.5

3.22

Облако

9

EduLLM-RU 27B (наша)

3.21

Локальная

10

GLM 5

3.20

Облако

11

GPT-5.4

3.20

Облако

Важная оговорка: разница с GPT-5.4 — 0.01 балла. Это на грани статистической погрешности, говорить, что мы “обогнали GPT-5.4” — технически верно, но честнее сказать: мы вышли на один уровень. Разница в том, что подготовка нашей модели стоила 30 000 рублей и работает локально, а GPT-5.4 — нет.

По отдельным модулям:

Модуль

EduLLM-RU 27B

GPT-5.4

Разница

A+B+C (образование)

3.35

3.33

+0.02

D (чувашский)

2.64

2.82

−0.18

На образовательных задачах (Модули A-C) мы немного впереди. На чувашском — GPT-5.4 лучше. Дообучение на чувашский — следующий этап.

Что пошло не так

  1. 32B провалилась. 45 часов обучения, всё выглядело хорошо по training loss — а на бенчмарке проиграла 27B на полбалла. Потерянные сутки GPU-времени.

  2. max_tokens ловушка с Gemini. При оценке моделей через Gemini 3.1 Pro, если поставить max_tokens: 512 — JSON обрезается, потому что reasoning tokens съедают бюджет. Поставили 4096, чтобы получить надёжный вывод.

  3. Судьи при оценке не согласны друг с другом. GPT-5.4 стабильно ставит выше за “actionability” (конкретные шаги), Gemini строже к фактической точности. Разброс ±0.3 балла на одной и той же работе — поэтому мы используем консенсус трёх судей, а не одного.

  4. Чувашский язык. Нет автоматического gold standard для проверки. Валидация требует носителей языка. Пока проверяем вручную — это не масштабируется.

Как это работает в реальной школе

Модель готовится к развертыванию на csylabs.com — планируется приватный инстанс на серверах Selectel. Данные не уходят за пределы российской инфраструктуры: это принципиальное требование по 152-ФЗ для школ. Сейчас в тесте работают несколько учителей в пилотном режиме.

Что они делают:

  • Подготовка заданий для ОГЭ

  • Адаптация материалов под разный уровень учеников

  • Консультация по формулировкам характеристик

Чего модель не делает (и это нормально):

  • Не проверяет тетради (справедливо отметили в комментариях к первой статье — это задача компьютерного зрения, до неё далеко)

  • Не заменяет учителя (относится и к первому пункту)

Что дальше

  1. Qwen3.5-9b — в комментариях попросили протестировать. Добавим в следующий раунд. Интересно, как маленькая модель нового поколения покажет себя на специализированных задачах, в идеале попробовать и версию 3.6.

  2. Чувашский LoRA — отдельный адаптер на ту же базу. Цель: закрыть разрыв в 0.18 балла с GPT-5.4 на Module D.

  3. Расширение бенчмарка — задачи ближе к ежедневной рутине учителя: генерация вариантов контрольных работ, адаптация учебника и конкретного урока под стиль преподавателя, составление отчётности.

  4. Открытые данные — если получится договориться с институтами (ЧГИГН, ЧГУ), опубликуем обучающий датасет, пока он синтетический. Готовимся разворачивать EduLLM-RU для школ и вузов по открытой методологии — csylabs.com/llm-integrator.


Бенчмарк: github.com/csylabs-org/edubench-ru

Если у вас есть школа, которая хочет попробовать — напишите. Ищем пилотные площадки.

Я — основатель ООО ЛИИ (Лаборатория инновационных инициатив). Пишу в @techaroundsports и на daniel.csylabs.com.