惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
Netflix TechBlog - Medium
J
Java Code Geeks
爱范儿
爱范儿
雷峰网
雷峰网
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
博客园 - 三生石上(FineUI控件)
H
Hackread – Cybersecurity News, Data Breaches, AI and More
B
Blog RSS Feed
Google DeepMind News
Google DeepMind News
Jina AI
Jina AI
The GitHub Blog
The GitHub Blog
I
InfoQ
月光博客
月光博客
博客园 - 聂微东
博客园 - Franky
The Cloudflare Blog
阮一峰的网络日志
阮一峰的网络日志
博客园_首页
G
Google Developers Blog
Blog — PlanetScale
Blog — PlanetScale
L
LangChain Blog
罗磊的独立博客
Apple Machine Learning Research
Apple Machine Learning Research

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Краткая история биометрии: как появилось распознавание по...
sokolovps (O · 2026-05-02 · via Все публикации подряд на Хабре

Краткая история биометрии: как появилось распознавание по голосу

Уровень сложностиПростой

Время на прочтение4 мин

Охват и читатели670

Ретроспектива

Мы продолжаем рассказывать про краткую историю биометрии. И нам осталось рассказать о распознавании голоса человека. 

Историю биометрии голоса обычно начинают с мейнфрейма AUDREY (Automatic Digit Recognizer), созданного в 1952 году в Bell Labs). Голоса разных людей он еще не распознавал, но уже их слышал, что по тем временам казалось чудом. Это устройство для «слышания» номеров, как писали в СМИ и рассказывали о ТВ, может избавить от необходимости набирать номер, но оно работает только при четком произношении цифр номера одну за другой. 

Источник: https://rauterberg.employee.id.tue.nl/presentations/bell-labs.pdf

Источник: https://rauterberg.employee.id.tue.nl/presentations/bell-labs.pdf

Дальше дело было за соответствующим ПО, которое могло бы конкурировать с «естественным интеллектом» человека, узнающего голос говорящего, даже не видя его, например, по телефону, из другой комнаты, путем моментального сравнения паттернов тембра, дикции, интонации, скорости речи говорящего с базой данных, хранящейся в головном мозге слушающего. А если голос незнакомый, то отправляющего его характеристики в ту же базу данных, где они, если они не чересчур шокирующие и не повторяются, долго не хранятся, забываются. Понятно, что в ПО команду что-то забыть мог дать только оператор

Работа в этом направлении шла в разных странах, в том числе у нас в Институте кибернетики АН УССР под руководством академика Глушкова. Желающие могут почитать статью 1968 года сотрудника Глушкова доктора технических наук Тараса Климовича Винцюка «Распознавание речи с помощью динамического программирования», опубликованную, кстати, на английском языке в журнале Kibernetika (англоязычном клоне советского журнала «Кибернетика», который выходил в США одновременно с очередными номерами у нас), и часто цитируемую сейчас в исторических обзорах. 

Схема из патента US4752958A

Схема из патента US4752958A

Но так уж получилось, что лидерами в этой области были итальянцы. Один из первых патентов на «Устройство верификации голоса» получили в 1983 году Микеле Кавацца и Альберто Чиарелла, инженеры туринского Исследовательского центра телекоммуникаций (CSELT). Там речь шла о сравнении голоса говорящего одну эталонную фразу с его же голосом, записанным ранее и говорившем ту же фразу. В 1990 году инженеры CSELT получили патент на систему распознавания голоса, интегрированную в микропроцессор с гарвардской архитектурой, где комбинация скрытой марковской модели и DTW-алгоритма обрабатывала речевые сигналы. А проще говоря, опустив айтишный лексикон, их микропроцессор «с большим словарным запасом», как писали его изобретатели, мог распознавать связную речь конкретного человека в режиме реального времени.

Схема из патента US4907278A

Схема из патента US4907278A

Голосовая биометрия относится к динамической ее разновидности, ее еще называют поведенческой (behaviometrics) в отличие от физической (или статической, или габитусной) биометрии по внешним признакам (отпечаткам пальцев, радужке глаза, пропорциям тела и лица) и почерку. Но в последнее время эта граница стирается. Например, при голосовой аутентификации к звуковым паттернам добавляется патерны движения губ говорящего (см., например, этот патент). 

При биометрии человека по особенностями его почерка, он оставляет его образец, например, подпись не на бумаге, а на экране графического планшета, а компьютер оцифровывает и запоминает характерны колебания пера и его давления на экран планшета. 

Система кодирования мимики человека (FACS) была разработана в 1970-е годы. В нулевые годы нашего столетия один за другим пошли патенты на «системы и методы автоматического кодирования мимики» (см. например, этот). Пока препятствие к массовому внедрению этой биометрии для идентификации – недостаток образцов для сравнения в базах данных. Но если дело пойдет так и дальше, то вместо чипа с фотографией его владельца в смартфоне или паспорте будет видеозапись, как мы улыбаемся, хмуримся, подмигиваем, показываем язык, шевелим ушами (кто умеет). 

Схема из патента US20100086215A1

Схема из патента US20100086215A1

К сожалению, это издержки бурной компьютеризации биометрии. Угроза со стороны хакеров стала во весь рост еще в 1990-е годы. А в 2001 году то, о чем сказано выше, с легкой руки завкафедрой компьютерных наук профессора Джорджтаунского университета Дороти Деннинг получило название «liveness», то есть жизненность или одушевленность по-русски.

По данным TAdviser, сегодня объем мирового рынка биометрических технологий оценивается в 42,6 млрд долларов, из которых больше половины (23,6 млрд) приходится на рынок потребительских биометрических систем. Прогноз на конец текущего года уже $80–100 млрд. Это большие деньги, и понятно, что владельцы этого бизнеса и их инвесторы могут рассчитывать на подобные темпы роста доходов только при условии достаточно надежной защиты их биометрических устройств от имитации и прямой кражи чужой биометрии, и, соответственно, инженерно-изобретательская мысль будет стимулироваться в первую очередь в области защиты.

О сервисе Онлайн Патент:

Онлайн Патент — цифровая система № 1 в рейтинге Роспатента. С 2013 года мы создаем уникальные LegalTech‑решения для защиты и управления интеллектуальной собственностью. Зарегистрируйтесь в сервисе Онлайн‑Патент и получите доступ к следующим услугам: