惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

雷峰网
雷峰网
爱范儿
爱范儿
宝玉的分享
宝玉的分享
Apple Machine Learning Research
Apple Machine Learning Research
博客园 - Franky
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 三生石上(FineUI控件)
人人都是产品经理
人人都是产品经理
阮一峰的网络日志
阮一峰的网络日志
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Last Week in AI
Last Week in AI
博客园 - 聂微东
大猫的无限游戏
大猫的无限游戏
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
罗磊的独立博客
博客园 - 叶小钗
WordPress大学
WordPress大学
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
酷 壳 – CoolShell
酷 壳 – CoolShell
小众软件
小众软件
博客园 - 司徒正美
博客园 - 【当耐特】
IT之家
IT之家

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Как связывание эмбеддингов душит трансформеры и уничтожае...
YH7H22 · 2026-05-18 · via Все публикации подряд на Хабре

Если вы когда-нибудь собирали языковую модель с нуля, вы наверняка знаете про Weight Tying (Связывание весов). Этот трюк был предложен в 2016 году в статье "Using the Output Embedding to Improve Language Models" и популяризован OpenAI в архитектуре GPT-2.

Суть предельно проста и математически изящна: мы берем матрицу входных эмбеддингов Win (размером Vocab_Size × Hidden_Dim) и используем её же транспонированную версию как выходной слой классификатора Wout

Смысл? Матрица словаря - самая жирная часть модели. Для словаря в 50 000 токенов и скрытой размерности 4096, одна такая матрица весит сотни мегабайт. Связав их, мы экономим колоссальный объем параметров. К тому же, это считалось отличным способом регуляризации.

Но на самом деле мы совершаем архитектурное преступление. Мы заставляем один и тот же тензор выполнять две прямо противоположные геометрические задачи. И платим за это уничтожением градиентов.

Геометрия чтения против геометрии письма

Чтобы понять масштаб проблемы, давайте подумаем, какова роль токена на входе в трансформер, и какова его роль на выходе.

1. Входной эмбеддинг (Чтение и Контекст)

Задача Win закодировать смысл слова для дальнейшей обработки. На этом этапе сети выгодно группировать (сжимать) похожие понятия. Для входных слоев слова "идти", "шел", "шагал" несут почти идентичную смысловую нагрузку.

Сеть располагает их векторы максимально близко друг к другу в латентном пространстве, чтобы внимание могло абстрагироваться от морфологии и работать со смыслом.

2. Выходной слой (Письмо и Точность)

Задача Wout это классификация. Трансформеру нужно выбрать один единственный правильный токен из 50 000 вариантов. И здесь геометрическая задача меняется на противоположную.

Если на входе "идти" и "шел" - это одно и то же, то на выходе это катастрофически разные вещи! Если сеть предсказывает следующее слово в предложении "Вчера он по улице...", она должна железобетонно выбрать "шел", а не "идти". Выходная матрица должна максимально раздвигать (сепарировать) грамматические и морфологические формы в пространстве, чтобы функция Softmax не "размазалась" между синонимами.

В чем абсурд Weight Tying: мы заставляем сеть использовать одну и ту же матрицу и для сжатия смыслов, и для их точечной сепарации.

Физика уничтожения градиентов

Давайте посмотрим на процесс обучения и увидим, как эта шизофрения разрушает оптимизацию.

Во время обратного прохода градиент течет от loss функции вниз. Сначала он проходит через выходной слой Wout Оптимизатор видит ошибку в предсказании токена и говорит матрице:

"Эй, векторы слов 'кошка' и 'кошки' расположены слишком близко, Softmax запутался. Раздвинь их!"

Формируется градиент ΔWin который направлен на сближение векторов.

Но постойте! Wout и Win это один и тот же кусок памяти!

Что делает оптимизатор? Он берет два противоположно направленных градиентных вектора и складывает их. Происходит физическая деструктивная интерференция градиентов (Gradient Cancellation).

Они частично гасят друг друга. Матрица весов оказывается в состоянии перетягивания каната: она не может ни нормально сжать пространство для входа, ни нормально растянуть его для выхода. Оптимизатор тратит огромную вычислительную емкость на то, чтобы найти компромиссный локальный минимум, вместо того, чтобы минимизировать Loss.

Выход из иллюзии: почему SOTA-модели развязывают веса

В эпоху моделей на 100-300 миллионов параметров (GPT-2, BERT), регуляризационный эффект от связывания весов перекрывал вред от интерференции градиентов. Модели не хватало данных, и связывание не давало ей переобучиться.

Но сегодня мы обучаем LLM на триллионах токенов. Риск переобучения минимален, а на первое место выходит выразительная способность сети. Нам нужно, чтобы каждый параметр работал на 100%.

Да, модель становится толще на пару гигабайт. Но взамен она получает свободу. Входная матрица строит чистую семантическую топологию, а выходная матрица выучивает идеальные разделительные гиперплоскости для предсказания токенов. Градиенты больше не сталкиваются лбами.

Заключение

Индустрия машинного обучения часто страдает от карго культа. Инженеры копируют архитектурные решения из старых пейперов просто потому, что "так делают все", не задумываясь о том, какую физику градиентов они закладывают в свои модели.

Связывание весов это красивый математический хак из 2016 года, который в 2026 году стал бутылочным горлышком. Не заставляйте вашу модель читать и писать одним и тем же полушарием. Разделите эмбеддинги, позвольте градиентам течь свободно, и вы удивитесь, насколько быстрее сойдется ваш Loss.