惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
雷峰网
雷峰网
Hugging Face - Blog
Hugging Face - Blog
IT之家
IT之家
H
Help Net Security
腾讯CDC
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
The GitHub Blog
The GitHub Blog
V
V2EX
M
MIT News - Artificial intelligence
Vercel News
Vercel News
WordPress大学
WordPress大学
博客园 - 三生石上(FineUI控件)
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
阮一峰的网络日志
阮一峰的网络日志
B
Blog RSS Feed
D
Docker
V
Visual Studio Blog
博客园 - 叶小钗
美团技术团队
S
SegmentFault 最新的问题
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
HUME — новый метод AB тестирования ИИ моделей в задачах а...
LirikVechniy · 2026-05-08 · via Все публикации подряд на Хабре

Уровень сложностиПростой

Время на прочтение2 мин

Охват и читатели1.8K

Мнение

Перевод

Уже 3 месяца я нахожусь в процессе разработки корпоративной RAG-системы и параллельно прохожу курсы по LLM. В такой работе я раз за разом наталкиваюсь на отсутствие возможности нормально оценить качество RAG. Собрать вопросы и ответы по собранной базе данных не сложно, особенно на тестовых прогонах.

Многие в своих работах пишут: мы достигли 85% точности! 85 % — это хорошо? Может, человек в этой задаче сделал бы 95%? Или наоборот. Без человеческого ориентира цифры висят в воздухе. Результат в конце концов оценивает человек. А он тоже умеет ошибаться.

Недавно наткнулся на исследование, которое приоткрывает завесу над этими вопросами. Группа авторов из Сбера, Стэнфорда и нескольких других институтов предложила подход HUME (Human Evaluation Framework for Text Embeddings).

Суть подхода

Авторы взяли 16 датасетов из популярного бенчмарка MTEB (задачи на классификацию, кластеризацию, поиск семантической близости, ранжирование), вручную их разметили, а затем сравнили, как с этими заданиями справляются люди и лучшие современные модели-эмбеддеры. В том числе на неродных для ИИ языках — арабском, русском, норвежском.

Что получилось

Средний результат: у человека — 77.6%, у лучшей модели (voyage-3) — 80.1%. Модель обошла человека, но отрыв минимальный.

Зато на задачах «найди самое похожее» (семантическая близость) ситуация обратная. Для арабского языка, где присутствует многозначность и культурные коннотации, человек показал 67.5%, модель — 40.9%. Разрыв огромный.

На «бедных» языках (мало данных для обучения), включая русский и норвежский, модели тоже заметно отстают от людей — особенно в анализе тональности.

В чистой классификации по жёсткому эталону (без двусмысленностей) модель выдаёт почти 100% — здесь ИИ вне конкуренции.

Отдельный эксперимент: когда авторы попробовали заменить людей-разметчиков на LLM, качество разметки упало (76.1% против 81.2% у людей). То есть даже крупные языковые модели пока не дотягивают до человека в задачах, требующих тонкого суждения.

Выводы

Для меня, как для человека, который сейчас проектирует RAG, этот результат - попытка нащупать некоторую почву в оценке работы своей системы.

P. S. ИИ отлично справляется с рутиной: задачи с чёткими правилами, где нет двусмысленности и ничего не меняется годами - можно смело отдавать моделям. Но как только появляются культурный код, тонкая семантика, контекст «между строк» — пока выигрывает человек. Особенно на русском языке, который не относится к «обильно кормленным» для LLM.

Как вы оцениваете качество RAG на русском языке? Делитесь опытом в комментариях.