惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
Netflix TechBlog - Medium
I
InfoQ
Engineering at Meta
Engineering at Meta
Jina AI
Jina AI
Recent Announcements
Recent Announcements
T
The Blog of Author Tim Ferriss
P
Proofpoint News Feed
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
D
Docker
Microsoft Security Blog
Microsoft Security Blog
宝玉的分享
宝玉的分享
Last Week in AI
Last Week in AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
GbyAI
GbyAI
博客园 - Franky
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
博客园 - 叶小钗
酷 壳 – CoolShell
酷 壳 – CoolShell
B
Blog RSS Feed
WordPress大学
WordPress大学
MyScale Blog
MyScale Blog
月光博客
月光博客
罗磊的独立博客

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
HUME — новый метод AB тестирования ИИ моделей в задачах а...
LirikVechniy · 2026-05-08 · via Все публикации подряд на Хабре

Уровень сложностиПростой

Время на прочтение2 мин

Охват и читатели1.8K

Мнение

Перевод

Уже 3 месяца я нахожусь в процессе разработки корпоративной RAG-системы и параллельно прохожу курсы по LLM. В такой работе я раз за разом наталкиваюсь на отсутствие возможности нормально оценить качество RAG. Собрать вопросы и ответы по собранной базе данных не сложно, особенно на тестовых прогонах.

Многие в своих работах пишут: мы достигли 85% точности! 85 % — это хорошо? Может, человек в этой задаче сделал бы 95%? Или наоборот. Без человеческого ориентира цифры висят в воздухе. Результат в конце концов оценивает человек. А он тоже умеет ошибаться.

Недавно наткнулся на исследование, которое приоткрывает завесу над этими вопросами. Группа авторов из Сбера, Стэнфорда и нескольких других институтов предложила подход HUME (Human Evaluation Framework for Text Embeddings).

Суть подхода

Авторы взяли 16 датасетов из популярного бенчмарка MTEB (задачи на классификацию, кластеризацию, поиск семантической близости, ранжирование), вручную их разметили, а затем сравнили, как с этими заданиями справляются люди и лучшие современные модели-эмбеддеры. В том числе на неродных для ИИ языках — арабском, русском, норвежском.

Что получилось

Средний результат: у человека — 77.6%, у лучшей модели (voyage-3) — 80.1%. Модель обошла человека, но отрыв минимальный.

Зато на задачах «найди самое похожее» (семантическая близость) ситуация обратная. Для арабского языка, где присутствует многозначность и культурные коннотации, человек показал 67.5%, модель — 40.9%. Разрыв огромный.

На «бедных» языках (мало данных для обучения), включая русский и норвежский, модели тоже заметно отстают от людей — особенно в анализе тональности.

В чистой классификации по жёсткому эталону (без двусмысленностей) модель выдаёт почти 100% — здесь ИИ вне конкуренции.

Отдельный эксперимент: когда авторы попробовали заменить людей-разметчиков на LLM, качество разметки упало (76.1% против 81.2% у людей). То есть даже крупные языковые модели пока не дотягивают до человека в задачах, требующих тонкого суждения.

Выводы

Для меня, как для человека, который сейчас проектирует RAG, этот результат - попытка нащупать некоторую почву в оценке работы своей системы.

P. S. ИИ отлично справляется с рутиной: задачи с чёткими правилами, где нет двусмысленности и ничего не меняется годами - можно смело отдавать моделям. Но как только появляются культурный код, тонкая семантика, контекст «между строк» — пока выигрывает человек. Особенно на русском языке, который не относится к «обильно кормленным» для LLM.

Как вы оцениваете качество RAG на русском языке? Делитесь опытом в комментариях.