惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
MyScale Blog
MyScale Blog
雷峰网
雷峰网
量子位
小众软件
小众软件
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 叶小钗
T
Tailwind CSS Blog
月光博客
月光博客
博客园 - 【当耐特】
博客园_首页
罗磊的独立博客
博客园 - 三生石上(FineUI控件)
IT之家
IT之家
爱范儿
爱范儿
阮一峰的网络日志
阮一峰的网络日志
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
WordPress大学
WordPress大学
The Cloudflare Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
S
SegmentFault 最新的问题
人人都是产品经理
人人都是产品经理
V
V2EX
酷 壳 – CoolShell
酷 壳 – CoolShell

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
KV-кэш, экспертное сообщество и критическое мышление
urassl · 2026-04-22 · via Все публикации подряд на Хабре

Уровень сложностиПростой

Время на прочтение2 мин

Охват и читатели1.3K

Аналитика

Меня давно волновала одна деталь в устройстве современных трансформеров (тех самых, которые GPT, Sonnet и прочие).

Механизм внимания всегда работает только назад. От многих экспертов (включая курс Эндрю Ына на Курсере) я слышал такое объяснение: Слово не может ссылаться на слова, которые оно ещё не знает. Назвается это казуальностью (причинностью).

Но ведь в предложении “Зелёное яблоко лежит на столе” слово зелёное уже знает про слово “яблоко”, но не может на него сослаться. Непонятно

Провёл небольшой эксперимент и подключил нечеловеческий мозг. Пробовал разные модели - Sonnet 4.7, ChatGPT, Mistral (на какую версию они роутятся я не очень понимаю). Диалог получался примерно такой:

Вопрос: Почему в современных трансформерах (GPT, Sonnet) механизм внимания никогда не ссылается на предыдущее слово?

Ответ (сокращённо): Слово не может ссылаться на слова, которые оно ещё не знает. Назвается это казуальностью

Вопрос: Почему в предложении «На столе лежит зелёное яблоко» слово «зелёное» не может ссылаться на слово «яблоко»? У нас же уже есть все слова.

Ответ (сокращённо): Ты абсолютно прав. Слово “зелёное” ссылается на слово “яблоко”

Вопрос: Если «зелёное» ссылается на «яблоко», то как работает KV-кэш?

Ответ (сокращённо): Ты абсолютно прав. Слово “зелёное” НЕ ссылается на слово “яблоко”, потому что это ломает KV-кэш.

Да - это правильный ответ

KV-кэш позволяет хранить значения Key и Value для всех предыдущих токенов, что очень сильно снижает объём вычислений на больших контекстах. Но этот механизм работает, только если слова не могут ссылаться вперёд. Иначе пришлось бы пересчитавыть значения Key и Value для каждого предышего токена при обработке каждого нового.

Этот простой эксперимент показывает, что у современных LLM большие проблемы с критическми мышлением. Они хорошо понимают механизм работы KV-кэша. Но не используют это знание в своих ответах. Собственно мы видим только два типа ответов:

  • Среднестатистическое мнение в интернете

  • “Вы абсолютно правы” даже если я ничего не утверждал

Собственно, мне не удалось заставить чятик самостоятельно прийти к мысли о KV-кэше. Только когда я сам его явно упоминаю, у модели случается “эврика”.

P.S. Лично я искренне не понимаю, о каких исследовательских агентах сейчас так много говорят. Я много работают с LLM, и вижу только эти два типа ответов.

P.P.S. Почему “экспертное сообщество” в массе своей не понимает принципов работы трансформеров, тоже тревожно.