惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

云风的 BLOG
云风的 BLOG
M
MIT News - Artificial intelligence
Recent Announcements
Recent Announcements
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Stack Overflow Blog
Stack Overflow Blog
J
Java Code Geeks
Microsoft Azure Blog
Microsoft Azure Blog
罗磊的独立博客
博客园 - 【当耐特】
H
Help Net Security
腾讯CDC
大猫的无限游戏
大猫的无限游戏
GbyAI
GbyAI
Last Week in AI
Last Week in AI
Jina AI
Jina AI
博客园 - 聂微东
Blog — PlanetScale
Blog — PlanetScale
A
About on SuperTechFans
Apple Machine Learning Research
Apple Machine Learning Research
P
Proofpoint News Feed
Y
Y Combinator Blog
C
Check Point Blog
博客园 - 司徒正美
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Навязчивая капча которую вы так не любили — на самом деле...
TehnoBlog (S · 2026-05-02 · via Все публикации подряд на Хабре

Вы вводили размытые буквы. Кликали на все светофоры. Выбирали велосипеды, автобусы, пешеходные переходы. Злились. Промахивались. Проходили заново.

И всё это время — обучали искусственный интеллект.

Без согласия. Без оплаты. Миллиарды раз по всему миру.

Это не теория заговора. Это задокументированная история одного из самых масштабных краудсорсинговых проектов в истории человечества. Просто вам об этом не сказали.

Как появилась капча — и зачем она была нужна на самом деле

2000 год. Интернет молодой, боты уже старые. Они регистрируют тысячи аккаунтов, рассылают спам, накручивают голосования.

Нужен был способ отличить человека от машины. Так появился CAPTCHA — Completely Automated Public Turing test to tell Computers and Humans Apart. Полностью автоматизированный тест Тьюринга для различения компьютеров и людей.

Идея простая: покажи что-то что человек легко распознает, а компьютер — нет. Размытые буквы. Искажённые цифры. Компьютеры 2000-х не умели их читать. Люди — умели.

Защита работала. Но один человек понял, что в этой системе спрятан огромный неиспользованный ресурс.

reCAPTCHA v1: как вы оцифровали миллионы книг

2007 год. Луис фон Ан — тот самый учёный, который придумал оригинальную капчу — создаёт reCAPTCHA.

Идея гениальная в своей простоте.

Google в то время занимался грандиозным проектом — оцифровкой книг. Сканеры переводили страницы в изображения, программы распознавания текста (OCR) превращали изображения в текст. Но старые книги, газеты, рукописи — с потёртыми страницами, старинными шрифтами, пятнами от времени — машины читали плохо. Примерно каждое седьмое слово распознавалось неверно.

Луис фон Ан предложил решение: пусть люди это исправят. Не зная об этом.

Новая reCAPTCHA показывала пользователю два слова. Одно — контрольное, компьютер знал правильный ответ. Второе — то самое сложное слово из старой книги, которое машина не смогла распознать.

Если с контрольным словом всё верно — значит человек настоящий. А его версия второго слова записывалась как правильная расшифровка. Когда несколько разных людей вводили одинаковый ответ — слово считалось распознанным.

Каждый день таким образом обрабатывалось около 200 миллионов капч. Каждый ввод — примерно 10 секунд человеческого труда. В сумме — 500 000 часов ежедневно.

За несколько лет пользователи интернета бесплатно оцифровали архивы New York Times начиная с 1851 года, миллионы книг для Google Books, документы которым сотни лет.

Луис фон Ан позже назвал это «искусством превращения человеческого времени в полезную работу». Компании сэкономили сотни миллионов долларов. Пользователи — не получили ничего, кроме раздражения.

Именно эти размеченные тексты стали частью датасетов, на которых потом обучали языковые модели — те самые, которые сегодня работают в новейших версиях ChatGPT и других текстовых нейросетях.

reCAPTCHA v1: как вы оцифровали миллионы книг

reCAPTCHA v1: как вы оцифровали миллионы книг

reCAPTCHA v2: как вы учили машины водить

2014 год. Google обновляет reCAPTCHA. Появляются те самые задания которые все помнят — и ненавидят.

«Выберите все квадраты с светофором» «Отметьте все изображения с автобусом» «Нажмите на все пешеходные переходы»

Казалось бы — защита от ботов усложнилась. На самом деле — изменилась цель.

К 2014 году у Google был уже другой масштабный проект: Waymo — беспилотные автомобили. И главная задача беспилотника — научить его видеть дорогу. Распознавать светофоры, пешеходов, автобусы, разметку. В любую погоду, под любым углом, в разных условиях освещения.

Для этого нужны были миллионы размеченных изображений. Фото светофора с подписью «светофор». Фото перекрёстка с отмеченными пешеходными переходами.

Вы это и делали.

Каждый раз когда вы кликали на квадраты с автобусом — вы добавляли точку в обучающую выборку компьютерного зрения. Каждый выбранный светофор — разметка для нейросети беспилотника.

Это же компьютерное зрение сегодня лежит в основе генераторов изображений. Именно оно позволяет таким инструментам как Midjourney или Nano Banana Pro «понимать» что находится на фото и создавать визуально осмысленные изображения. Кстати, именно благодаря этому Нано Банана про умеет без ошибок писать тексты на изображениях.

Что ещё вы делали — и не знали об этом

Капча была самым очевидным примером. Но не единственным.

Лайки и дизлайки на YouTube, рекомендации в Netflix, оценки в магазинах приложений — всё это обучало рекомендательные алгоритмы. Каждый ваш выбор говорил системе: вот это нравится людям похожим на тебя, вот это нет.

Поисковые запросы в Google — миллиарды формулировок, исправлений, уточнений — стали датасетом для понимания человеческого языка. Как люди формулируют мысли. Какие слова считаются синонимами. Как меняется запрос когда результат не устраивает.

Фотографии в Instagram и Facebook — миллиарды изображений с подписями, тегами, геолокацией — обучали модели компьютерного зрения понимать что изображено на фото. Именно эти датасеты стали фундаментом для современных генераторов видео вроде Kling и инструментов озвучки вроде ElevenLabs.

Голосовые помощники — каждый раз когда вы говорили «окей Google» или «Алиса» и исправляли неправильно распознанное слово — вы размечали данные для систем распознавания речи.

Переводчик Google долгие годы учился в том числе на том как люди исправляли его переводы. Кнопка «предложить улучшенный перевод» — это была форма сбора обучающих данных.

По сути весь ваш цифровой след последних двадцати лет — это обучающие данные для современных мощных нейросетей. Просто никто не формулировал это именно так.

Когда всё изменилось

В какой-то момент краудсорсинг незаметных пользователей перестал быть достаточным.

Языковые модели стали сложнее. Генераторы изображений потребовали миллиардов размеченных примеров. Появились задачи где нужна была не просто разметка «светофор / не светофор», а тонкое понимание контекста, нюансов, качества.

Компании начали нанимать людей — специалистов по разметке данных, операторов RLHF (обучение с подкреплением от человеческой обратной связи). Появились целые индустрии. Но основа — те самые миллиарды капч и лайков — уже была заложена.

Сегодня модели обучаются по-другому. Claude от Anthropic, Gemini от Google, GPT-5.4 — за каждой из них стоят годы осознанной работы с данными, тонкой настройки, проверки качества. Именно поэтому современные нейросети могут давать невероятные результаты, порой неотличимые от продукта, созданного реальными людьми.

Эпоха случайного краудсорсинга закончилась. Началась эпоха осознанного использования.

Что это значит для вас сейчас

Всё что создавалось годами вашим и чужим трудом — сейчас доступно как инструмент.

Языковые модели, которым помогли ваши поисковые запросы. Компьютерное зрение, которое тренировали ваши клики по светофорам. Генераторы речи, которые учились на ваших голосовых командах.

Сегодня это не абстракция — это конкретные инструменты. Текстовые нейросети, генераторы изображений, видео, голоса. На Study AI всё это собрано под одной подпиской: Claude, ChatGPT, Midjourney, Nano Banana Pro, Kling, ElevenLabs и другие.

Вы уже вложили в это своё время — когда вводили капчи, лайкали видео и исправляли переводы. Теперь можно получить что-то взамен.

Итог

В следующий раз когда увидите капчу — знайте: где-то в мире нейросеть стала чуть умнее.

История с капчей — это не история обмана. Это история о том как технологические компании нашли способ масштабировать сбор данных до невероятных объёмов. Эффективно. Дёшево. Незаметно.

И о том что инструменты, которые мы строили сами не подозревая — теперь в наших руках.

Попробовать нейросети на Study AI