惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 司徒正美
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Last Week in AI
Last Week in AI
大猫的无限游戏
大猫的无限游戏
博客园 - Franky
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
爱范儿
爱范儿
The Cloudflare Blog
阮一峰的网络日志
阮一峰的网络日志
博客园 - 叶小钗
博客园_首页
有赞技术团队
有赞技术团队
WordPress大学
WordPress大学
宝玉的分享
宝玉的分享
V
V2EX
V
Visual Studio Blog
博客园 - 三生石上(FineUI控件)
S
SegmentFault 最新的问题
量子位
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Apple Machine Learning Research
Apple Machine Learning Research
美团技术团队

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Ваш трансформер постоянно переобучается? Тогда мы идём к вам
ninja_cat · 2026-06-26 · via Все публикации подряд на Хабре

Ваш трансформер постоянно переобучается? Тогда мы идём к вам

Средний

3 мин

530

Пожалуйста, будьте осторожны с кухонными приборами!

Пожалуйста, будьте осторожны с кухонными приборами!

1. Вступление

Вот смотрите: кинули в мясорубку не только мясо, но и другие ингредиенты. Что получилось? Уже не чистый фарш, а какая-то смесь всего со всем. А если для каждого ингредиента взять свой инструмент - получим чистый продукт. В нейросетях то же самое: общие веса = общая мясорубка. Обучили на кошках, потом на машинах, всё смешалось. Кошки забыты.

Это catastrophic forgetting. 30 лет проблемы. Тысячи статей. Регуляризация, replay, elastic weight consolidation, всё похоже на какие-то костыли. Решение лежит на поверхности.


2. Инсайт: забывание ≠ стирание

Триведи и товарищи в июне 2026 показали: если после забывания заморозить все слои и переобучить только классификатор - точность возвращается с 0% до 76%. Знания на том же месте, где и были. Сломан доступ. Машина на парковке, ключ не подходит. Но машина там.


3. Результат: цифры

Обычный подход: обучили ResNet-18 на первой задаче CIFAR-100 → 58% точности. Добавили вторую задачу → 2% на первой. Забыли всё напрочь.

С изоляцией: обучили на первой → 58%. Добавили вторую → те же 58%. Ничего не потеряно…

Два независимых запуска: только на процессоре 5 проходов и Google Colab T4 20 проходов - один итог.

На 50 задачах подряд: изоляция 79%, общий подход 57%. Отрыв 22 процентных пункта при точности маршрутизации 99%.

Код: github.com/sensus-stoa/paradigm-swarm


4. Что с этим делать - изолировать.

Если забывание - это когда общие веса перезаписывают друг друга, решение простое: убери общие веса.

Если мы постоянно что-то забываем то, мы выносим это на карточки, в телефон, в базу знаний. Делим знание на домены. И каждый домен знает, что мы в нём ищем. Вряд ли мы будем смс искать у себя на столе. В телефоне не будем искать ручные записи ручкой. Сама среда подсказывает куда идти, если она организована правильно, а также жёстко разграничена с другой.

С нейросетями то же самое. Каждая задача получает своего изолированного эксперта. Добавил задачу, добавил эксперта. Старые не трогаешь. Маршрутизация: новый запрос, эксперт сам определяет «моё или нет». Без отдельной маршрутизации. Без LLM.


5. Почему не серебряная пуля. Честно.

Если мы подаём нейросети только кошек разных пород, то глупо думать, что обычный трансформер с этим не справится. Справится и довольно неплохо. Здесь нет разных доменов, только один с разными признаками. Кошки, собаки и лошади - другое дело.

Изоляция не бесплатна. На двух-трёх похожих задачах общие веса выигрывают через перенос знаний. Paradigm Swarm для тех случаев когда задач много и они разные. На MNIST метод не бьёт обычный подход. И это нормально.


6. Почему сейчас

Все вокруг говорят, что взаимодействие малых структур побеждает одну большую махину. Рой агентов эффективнее чем одна генеративная сеть. Но если мы нарежем генеративную сеть на домены и сохраним присутствие этих весов - мы получим нечто большее чем генеративный ИИ. Где-то даже предиктивный ИИ.

В 2026 сразу четыре независимых группы пришли к изоляции. Kermiche из Western Digital, Siddika из Iowa State, Li из Сианьского университета, Trivedi. Мы ведём обсуждение с коллегами. Плюс Ноам Шазир — человек который изобрёл Sparse Mixture of Experts и Attention Is All You Need — ушёл из Google 18 июня. Сдвиг происходит. Идея витает в воздухе.

Есть пример, на базе знаний портала vikent.ru 3609 записей, 274 раздела. Маршрутизация сама определяет к какому разделу относится новый текст. Загружаешь статью про физику, система находит «Научные парадигмы», а не «Религии». Загружаешь про буддизм - не лезет в физику. Точность 90%. Без нейросетей. На простых сочетаниях букв.


7. Код

git clone https://github.com/sensus-stoa/paradigm-swarm
cd experiments
python3 paradigm_swarm_benchmark.py

Всё легко запускается, Ничего не надо настраивать. Потыкайте, позапускайте бенчмарки. Если интересно статья на Zenodo.

Приглашаю присоединится к дискуссии. Если есть пересечения и есть интерес.


8. Вывод

Поскольку одна и та же мысль уже витает в воздухе, вопрос только один. Кто найдёт в себе смелость отказаться от трансформеров первым?


Ссылки: