惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Project Zero
Project Zero
T
The Blog of Author Tim Ferriss
云风的 BLOG
云风的 BLOG
Recent Announcements
Recent Announcements
月光博客
月光博客
B
Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Microsoft Security Blog
Microsoft Security Blog
The GitHub Blog
The GitHub Blog
Last Week in AI
Last Week in AI
罗磊的独立博客
NISL@THU
NISL@THU
酷 壳 – CoolShell
酷 壳 – CoolShell
P
Proofpoint News Feed
H
Help Net Security
L
LINUX DO - 最新话题
MongoDB | Blog
MongoDB | Blog
雷峰网
雷峰网
The Hacker News
The Hacker News
Apple Machine Learning Research
Apple Machine Learning Research
I
Intezer
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Know Your Adversary
Know Your Adversary
Recent Commits to openclaw:main
Recent Commits to openclaw:main
S
Secure Thoughts
爱范儿
爱范儿
aimingoo的专栏
aimingoo的专栏
C
CERT Recently Published Vulnerability Notes
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
N
News and Events Feed by Topic
F
Full Disclosure
人人都是产品经理
人人都是产品经理
Blog — PlanetScale
Blog — PlanetScale
Recorded Future
Recorded Future
T
Threat Research - Cisco Blogs
博客园 - 三生石上(FineUI控件)
S
Securelist
T
The Exploit Database - CXSecurity.com
Forbes - Security
Forbes - Security
H
Hacker News: Front Page
Security Archives - TechRepublic
Security Archives - TechRepublic
C
Check Point Blog
Hacker News - Newest:
Hacker News - Newest: "LLM"
V
Visual Studio Blog
Application and Cybersecurity Blog
Application and Cybersecurity Blog
T
Tor Project blog
博客园 - 司徒正美
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
Почему model collapse может оказаться коллапсом не только моделей
sslock · 2026-06-27 · via Все публикации подряд на Хабре

Простой

8 мин

4

«Мы принадлежим крестоформу?»

«Мы принадлежим крестоформу?»

Коллапс моделей

Проблема коллапса моделей, или model collapse, сегодня хорошо известна. Если следующую генеративную модель обучать на текстах, созданных предыдущей, распределение обучающих данных начинает сужаться от поколения к поколению. Сначала исчезают редкие случаи: необычные обороты, маловероятные сочетания, локальные знания, отклонения от нормы. Затем беднее становится и сама норма.

Каждая отдельная генерация при этом может выглядеть убедительно: грамматически правильной, логичной и узнаваемой. Ошибка проявляется не как сразу заметный бред, а как постепенное сокращение пространства возможного.

Это похоже на последовательность копий: первая почти неотличима, десятая всё ещё узнаваема, сотая сохраняет общий контур, но теряет детали, которые никто не считал важными, пока они не исчезли.

Здесь необходима оговорка. Коллапс моделей не считается неизбежным: эксперименты показывают, что сохранение исходного человеческого корпуса данных и контролируемое добавление синтетических данных могут стабилизировать обучение. Но пока это больше похоже на способ сдерживать деградацию, чем на окончательное решение. Система по-прежнему требует постоянного внешнего якоря, а редкие части распределения могут исчезать первыми.

Для AI-компаний это хотя бы инженерная задача: корпус можно очистить, пересобрать, заново взвесить и повторить обучение.

У людей такой возможности нет.

Племя Бикура

В романе Дэна Симмонса «Гиперион» существует племя Бикура — потомки колонистов, исчезнувших несколько столетий назад. Они носят на груди крестоформ: паразитический организм, способный после смерти восстановить своего носителя.

Крестоформ исполняет одно из древнейших человеческих обещаний. Он побеждает смерть.

Но восстанавливает человека не идеально. Каждое новое воскрешение оказывается реконструкцией предыдущей реконструкции. Через множество циклов Бикура сохраняют общую человеческую форму, но утрачивают значительную часть того, что делало их людьми.

Они становятся ниже, грубее, интеллектуально беднее и почти неразличимыми друг от друга. Исчезают не только личные особенности, но и сами половые признаки. Их тела постепенно сглаживаются, становясь бесполыми, почти кукольными. Вместе с различиями исчезает способность к размножению.

Они бессмертны, но стерильны.

Это важная деталь. Коллапс не просто портит копию. Он удаляет всё, что не требуется для сохранения минимально узнаваемой формы. Пол, индивидуальность, интеллект и репродуктивная способность оказываются избыточной сложностью.

Крестоформ не уничтожил племя. Он сохранил его. Бикура продолжают существовать, говорить, совершать ритуалы и поддерживать устойчивое сообщество. Они утратили не жизнь, а способность породить продолжение, отличающееся от бесконечного восстановления уже существующей формы.

Это почти идеальная метафора коллапса модели.

Но, возможно, не модели следует считать её главным объектом.

Человек внутри обучающего контура

Обычная схема коллапса выглядит просто:

человеческие данные обучают модель;
модель создаёт синтетические данные;
синтетические данные обучают следующую модель.

Опасность видят в последнем переходе. Модель начинает учиться на собственных отражениях и постепенно принимает реконструкцию мира за сам мир.

Но современный контур уже длиннее:

человеческая культура создаёт модель;
модель производит тексты, изображения и объяснения;
люди читают их, используют и присваивают;
модельные конструкции входят в человеческий язык и мышление;
люди производят новые тексты уже под их влиянием;
следующая модель обучается на этих текстах как на человеческих.

На этом этапе различие между человеческими и синтетическими данными перестаёт быть достаточным.

Текст может быть полностью набран человеком и при этом оставаться продуктом модельного контура. Автор мог получить от модели структуру аргумента, исходные категории, примеры, допустимые возражения и представление о том, как должен звучать убедительный текст. Затем он переписал всё своими словами. Ни детектор, ни водяной знак уже не покажут происхождения мысли.

Формально это человеческий текст.

Но независимым человеческим источником он уже не является.

Модели не просто добавляют синтетический материал в интернет. Они меняют самих производителей «настоящих» данных. Человек перестаёт быть независимым источником вне системы и становится промежуточным звеном обратной связи.

Именно здесь техническая проблема превращается в культурную.

Улучшение без разнообразия

У этого процесса нет причины выглядеть как деградация.

Наоборот, в каждом отдельном случае модель часто улучшает результат. Она исправляет язык, предлагает структуру, расширяет список аргументов, убирает повторы и помогает человеку выразить то, что он не сумел бы сформулировать самостоятельно. Слабый автор начинает писать лучше. Медленный — быстрее. Неуверенный получает гладкий и убедительный текст.

Это реальная польза, а не маркетинговая иллюзия.

Но индивидуальное улучшение не гарантирует улучшения среды.

Если тысячи людей получают помощь от одних и тех же моделей, обученных на сходных корпусах и оптимизированных под сходные представления о хорошем ответе, их тексты могут становиться лучше по отдельности и одновременно — похожими друг на друга.

Система поднимает среднее качество и сокращает разброс.

Для отдельного пользователя это выгодный обмен. Для культуры разброс может быть важнее среднего. Новые направления возникают не из аккуратного воспроизведения нормы, а из отклонений: странных формулировок, непопулярных вопросов, локальных традиций, ошибочных догадок и людей, которые ещё не научились правильно объяснять, что имеют в виду.

Большинство таких отклонений ни к чему не приводит. Они выглядят как шум. Но без этого шума культура способна только улучшать уже известное.

Коллапс модели тоже начинается с удаления шума.

Исчезновение источника

Проблема состоит не только в том, что интернет заполняется автоматически созданными страницами. Одновременно сокращается производство первичного человеческого материала.

Человек, который получил ответ от чат-бота, не задаёт вопрос на форуме. Он не описывает ход попыток, не спорит с другими участниками и не оставляет публичную запись своей ошибки. Студент, получивший готовую структуру, не сохраняет промежуточные версии рассуждения. Специалист, использующий автоматическое резюме, может не написать собственного разбора статьи.

Интернет при этом не становится пустым. Напротив, текста становится больше.

Но исчезает след, по которому можно было восстановить, как человек пришёл к результату. Культура состоит не только из правильных ответов. Она состоит из историй ошибок, несовершенных наблюдений, конфликтующих объяснений и множества несовместимых способов смотреть на один объект.

Модель легко создаёт итог. Гораздо труднее создать независимый источник опыта, которого раньше не существовало.

Если первичное человеческое производство сокращается, чистые данные не просто скрываются под синтетическим мусором. Они перестают возникать.

Архив интернета до появления генеративных моделей способен сохранить прошлое. Он не способен создать новое настоящее.

Человеческий корпус

Разработчики моделей уже начинают относиться к проверенным человеческим данным как к ограниченному ресурсу. Старые книги, научные публикации, архивы сайтов и лицензированные коллекции приобретают новую ценность. На фоне синтетического потока происхождение данных становится частью их качества.

Можно представить, что техническая проблема будет хотя бы временно решена. Компании создадут закрытые чистые корпуса, научатся фильтровать автоматические тексты и сохранят достаточно человеческого материала для обучения следующих поколений моделей.

Но модель можно обучить на романе, написанном в 1980 году, а человеческий опыт 2040 года из него извлечь нельзя. Старый корпус способен поддерживать языковое разнообразие модели, но не способен заменить людей, которые должны произвести новое знание, новую культуру и новые формы восприятия.

Чтобы такие данные появились, недостаточно сохранить старые книги. Необходимо сохранить людей, способных создавать то, чего ещё нет в книгах.

Это совсем другая задача.

Почему маркировка не спасает

Маркировка синтетического контента необходима, но отвечает только на вопрос, кто непосредственно создал файл. Она не показывает, кто сформировал автора.

Человек может получить от AI план статьи, переписать результат, добавить личный пример и опубликовать всё под собственным именем. Такой текст действительно написал человек. Но культурная петля уже замкнулась.

Знание о происхождении тоже не отменяет влияния. Мы можем понимать, что читаем машинный текст, и всё равно усваивать его словарь, структуру, набор нормальных аргументов и границы допустимого вопроса.

Загрязнение культуры не обязательно происходит через тайную подмену человека машиной. Оно может быть открытым, добровольным и полностью осознанным.

Бикура знали о крестоформе.

Они считали его спасением.

Катастрофа без события

У культурного коллапса модели, вероятно, не будет одного момента, когда всё сломается.

Поиск станет немного менее полезным. Статьи — немного более похожими. Академические тексты — более гладкими и менее содержательными. Реклама, инструкции, новости и комментарии будут выглядеть достаточно нормально. Люди продолжат работать, спорить и публиковаться.

Каждое изменение по отдельности окажется слишком малым, чтобы назвать его катастрофой.

Затем новое состояние станет стандартом. Дети будут учиться писать в среде, где большая часть доступной речи уже прошла через модели. Молодые специалисты будут осваивать профессии по материалам, созданным или переработанным AI. Авторы будут определять хороший стиль по текстам, оптимизированным системами, которые сами обучались на предыдущем представлении о хорошем стиле.

Через несколько циклов сравнивать станет не с чем.

Мы заметим не начало процесса, а момент, когда он уже изменил инструменты наблюдения. Оценивать состояние культуры будут люди, сформированные этой культурой. Измерять сокращение разнообразия будут категории, уже возникшие внутри сокращённого пространства.

Культурная деградация способна изменить само представление о том, что считать потерей.

Проблема без решения

У этой статьи нет списка мер.

Можно маркировать синтетические тексты, сохранять архивы, ограничивать автоматическую генерацию в образовании и поддерживать авторов, которые работают с первичным опытом. Всё это, вероятно, имеет смысл. Но ни одна из этих мер не решает проблему, если сама проблема поставлена верно.

Мы пока не знаем даже, что именно следует измерять.

Словарное однообразие? Сокращение разнообразия аргументов? Исчезновение редких культурных форм? Зависимость людей от готовых структур? Снижение способности начать рассуждение без машинной подсказки? Всё это может быть отдельными симптомами. Но из них ещё не сложилась теория процесса.

У коллапса модели есть математическое описание и хотя бы приблизительно определённый объект: распределение обучающих данных. У человеческого аналога нет ни согласованного названия, ни единицы измерения, ни контрольной группы. Мы разворачиваем эксперимент над всей информационной средой одновременно, не сохраняя мира, с которым затем можно будет сравнить результат, и делаем это без какого-либо бэкапа.

Возможно, никакого человеческого коллапса не произойдёт. Люди могут адаптироваться к новому инструменту, как адаптировались к письму, печати, фотографии и интернету. Модели могут расширить пространство культуры, снизив цену выражения и дав голос тем, кто раньше не мог им воспользоваться.

Но эта оптимистическая версия тоже остаётся предположением.

Этого недостаточно, чтобы объявить катастрофу. Но достаточно, чтобы признать проблему и не относиться к ней как к обычному недостатку технологии, который исправят следующей версией.

Заметный ущерб здесь по определению будет поздним. Если исчезнут некоторые способы думать, некому будет составить их полный список. Если культура утратит способность производить радикально новое, она продолжит производить убедительные объяснения того, почему ничего важного не потеряно.

Модель можно переобучить на сохранённом корпусе. Людей нельзя вернуть к предыдущей версии.

В «Гиперионе» крестоформ не убивает своих носителей. Он продолжает исправно воскрешать их, раз за разом сохраняя минимально необходимую человеческую форму. Всё лишнее постепенно исчезает: сложность тела, различия между людьми, интеллект, пол.

Бикура понимают, что с ними случилось, последними.

Возможно, у нас пока нет решения.

Но это плохая причина не замечать проблему, конечная стадия которой буквально выглядит как общество без половых признаков.