Image default
Нейросети

Как ИИ «слышит» и «понимает» человеческую речь на совещаниях

ИИ-ассистенты для встреч умеют расшифровывать диалоги, выделять суть и даже фиксировать задачи с ответственными. Но как они работают? Почему все еще ошибаются и что делают разработчики, чтобы их улучшить?Руководитель ИИ-направления МТС ЛинкОб эксперте: Дмитрий Крюков — руководитель ИИ-направления МТС Линк. Руководит разработкой и запуском всех функций платформы МТС Линк на основе искусственного интеллекта — от цифровых аватаров и масок до ИИ-помощника и саммаризации. Согласно исследованиям, ИИ-инструменты МТС Линк способны экономить сотрудникам до 12 часов в неделю.

Каждый день в мире проходят сотни миллионов онлайн-совещаний. С развитием технологий появилась возможность массово записывать и расшифровывать их — и бизнес активно ею пользуется. Мировой рынок распознавания речи и голоса растет огромными темпами: по данным Fortune Business Insights, в 2025 году он оценивался в $19,09 млрд, а к 2034 году ожидается его увеличение более чем в пять раз — до $104,05 млрд.

Вместе со спросом на такие решения растут ожидания бизнеса и пользователей. Сегодня от ИИ-ассистентов для встреч все чаще ждут не просто расшифровки, а настоящего «понимания» сути разговора. За этой задачей стоит сложнейший процесс на стыке акустики, статистики и лингвистики.

Как ИИ превращает звук в текст

«Слух» ИИ-ассистента для встреч — это система распознавания речи (Automatic Speech Recognition — ASR). Она переводит звук в текст. Вот из каких этапов состоит этот процесс:

  • Оцифровка. Микрофон улавливает звуковые волны и преобразует их в электрический сигнал. Дальше аналого-цифровой преобразователь превращает его в цифровой поток, делая 16 тысяч замеров — «снимков» звука — в секунду: это стандарт для систем распознавания речи. Этот поток и есть основа для всей дальнейшей работы.
  • Подготовка сигнала и выделение акустических признаков. Сначала аудиотракт конференции убирает лишнее: подавляет эхо, фоновый шум и вибрации — этим занимаются отдельные алгоритмы, еще до распознавания. Затем очищенный сигнал переводится в компактное представление — спектрограмму, которая показывает, какие частоты и с какой силой звучат в каждый момент времени. Именно с ней дальше работают нейросети.
  • Акустическое моделирование. На этом этапе в дело вступают нейросети: энкодер и декодер. Энкодер — нейросеть-кодировщик — превращает акустические признаки в набор чисел. Декодер — нейросеть-расшифровщик — по этому коду вычисляет наиболее вероятную последовательность символов и собирает из них текст.
  • Языковое моделирование. Даже при высоком качестве исполнения предыдущих этапов ASR может ошибаться. Например, фразы «наша компания» и «наша кампания» на слух неразличимы, а смысл у них разный. Снизить вероятность ошибок при расшифровке спорных слов/фраз помогает подключение к процессу больших языковых моделей (Large Language Models — LLM): они анализируют, какие сочетания слов чаще встречаются в ходе беседы, и выбирают самые вероятные варианты. Так, если на совещании обсуждают рекламные бюджеты и охваты, модель «поймет», что речь, скорее всего, идет о «кампании», а если перечисляют стратегических партнеров — о «компании».

Все четыре этапа занимают доли секунды.

Как ИИ распознает говорящих

Если в одном помещении говорят несколько спикеров, параллельно с распознаванием речи идет диаризация — этап, когда система делит аудиозапись по голосам. Это позволяет понять, кто именно что и когда сказал.

Для этого ИИ анализирует тембр, частотный диапазон, ритм и длительность пауз каждого говорящего. Из данных формируется «голосовой отпечаток» — уникальный звуковой профиль участника совещания. Похожие отпечатки группируются, и система присваивает им метки — условно, «Спикер 1», «Спикер 2» и т. д.

Результаты работы ASR и диаризации объединяются: к каждому распознанному слову привязывается метка говорящего. Так вместо сплошного потока текста пользователь получает диалог, где все реплики привязаны к конкретным людям.

Как ИИ вычленяет из диалога смысл совещания

Расшифровка совещания с разбивкой на реплики — только первый шаг в работе ИИ-ассистента для встреч. Чтобы превратить ее в структурированный протокол совещания, он задействует технологии обработки естественного языка (Natural Language Processing — NLP). Они решают три задачи:

  • Формирование саммари. Чтобы отсеять все лишнее и оставить суть, ИИ анализирует текст и отбирает наиболее значимые предложения по наличию ключевых слов (терминов, которые часто встречаются в тексте и отражают его тему), положению в структуре документа и наличию маркеров важности («договорились», «решили», «утвердили» и других подобных фраз). Отобранные фрагменты собираются в краткий пересказ без изменений.
  • Формирование генеративного саммари. В рамках выполнения этой задачи ИИ пересказывает суть разговора связным текстом. Для этого используются большие языковые модели: они анализируют содержание, выделяют логические блоки и формулируют итоги. Такой пересказ удобно читать и использовать в работе — отправлять коллегам или включать в отчеты.
  • Выделение задач и ответственных. Задачи на совещаниях не всегда ставят прямо. Часто они звучит примерно так: «Сергей, наверное, сможет все подготовить?» или «Хорошо бы иметь отчет к пятнице». Системе нужно распознать в такой фразе задачу, определить ответственного и, если возможно, срок исполнения. Здесь снова в дело вступают LLM: они анализируют расшифровку целиком, учитывают контекст и вытаскивают задачи. В итоге получается готовый список поручений с указанием ответственных.
  • Адаптация саммари под контекст. Чаще всего встроенные в коммуникационные платформы ИИ-помощники составляют саммари в едином формате, общем для всех встреч. Следующий шаг — полностью делегировать ИИ подготовку итоговых документов с учетом формата онлайн-мероприятий. Например, если на встрече HR-специалист проводил собеседование, ассистент составит характеристики кандидата по шаблону. А если команда собиралась на мозговой штурм, итоги будут включать в себя список новых идей.
Читать далее:
Новая нейросеть Google Nano Banana 2 стала точнее и стабильнее

Таким технологии NLP превращают расшифровку встречи в полноценный рабочий документ с кратким содержанием, ключевыми итогами и конкретными задачами.

Почему ИИ может ошибаться

Даже самые продвинутые ИИ-ассистенты для встреч регулярно дают сбои. Эти ошибки делятся на две группы: те, что возникают на этапе распознавания звука, и те, что связаны с интерпретацией смысла.

Ошибки распознавания

  • Шум. В идеальных условиях — при отсутствии посторонних звуков и использовании говорящими качественных микрофонов — точность распознавания достигает 95−98%. Но реальные, особенно гибридные, совещания часто проходят под гул кондиционера, шум за окном, эхо в помещении и другие звуковые помехи. На типичном видеозвонке точность опускается примерно до 85−92% — то есть неверно распознанным может оказаться каждое десятое слово. А если кто-то говорит, отвернувшись от микрофона, или сидит в дальнем конце переговорной, качество падает еще сильнее.
  • Акценты и диалекты. Раньше модели учили в основном на дикторской речи — новостях, аудиокнигах, подкастах, и любое отклонение от нее сбивало систему. Сегодня все иначе: современные модели обучают на сотнях тысяч часов самой разной речи, включая спонтанные разговоры, телефонные записи и заведомо шумное аудио, — именно поэтому они стали заметно устойчивее. Но сложные случаи остались: сильный региональный акцент, очень быстрая или смазанная речь, ситуации, когда русский язык не родной для говорящего. Здесь ИИ по-прежнему может начать угадывать, и чем дальше произношение от усредненного, тем выше вероятность ошибки. Если участник говорит с сильным региональным акцентом или использует диалектные слова, ИИ может не понять говорящего. И чем дальше произношение от «усредненного» литературного, тем выше вероятность ошибки. Эта проблема становится особенно острой в компаниях, где русский язык не родной для многих сотрудников.
  • Несколько человек в переговорной. Когда несколько человек говорят одновременно, разделить их голоса технически возможно, но заметно сложнее — и качество расшифровки на таких фрагментах падает: в тексте появляются обрывки фраз. Еще чувствительнее система к числу участников, если они находятся в одном помещении: развести двух собеседников она может почти безошибочно, но на встрече с шестью активными спикерами ошибок атрибуции становится в разы больше. И даже когда участники говорят по очереди, но быстро сменяют друг друга, реплики иногда приписываются не тем людям, а часть слов теряется.

Ошибки интерпретации

  • Похожие слова. Естественный язык полон неоднозначностей, которые способны создавать сложности для ИИ. Один из примеров — омофоны, слова, которые звучат одинаково, но пишутся по-разному («плод» и «плот», «луг» и «лук»). Если контекст не дает подсказки, при столкновении с ними языковая модель может ошибиться.
  • Недоговоренности. В разговоре мы часто обрываем фразы. Например: «Доделаем завтра…». В таких случаях человек способен понять, о чем идет речь, по контексту и интонации. Но ИИ видит только обрывок текста и не всегда может догадаться, что имелось в виду. В результате расшифровка теряет связность, а выделение задач из такого фрагмента становится невозможным.
  • Ирония и сарказм. Фраза «Отличная идея, просто гениальная» в ответ на провальное предложение — явная насмешка. Но в большинстве систем модель, которая готовит саммари, интонацию не слышит вовсе: до нее доходит только текстовая расшифровка, где вся эмоциональная окраска уже потеряна. Поэтому такая реплика легко попадает в итоги встречи как искренняя поддержка идеи.
  • Профессиональный жаргон и аббревиатуры. В обиходе каждой компании есть своя привычная лексика: KPI, OKR, CRM, «залить в прод», «поднять базу», «заапрувить». Если модель не обучалась на корпоративных текстах, она может домысливать такие слова или пропускать их.

Ошибки распознавания и интерпретации накладываются друг на друга и в конечном счете сказываются на итоговом результате: неточная расшифровка усложняет понимание смысла, а неверно понятый смысл снижает качество саммари и ведет к погрешностям при выделении задач.

Похожие записи

Маск рассказал, когда ИИ превзойдет интеллект всего человечества

admin

Что тормозит развитие ИИ-технологий в России: ответ эксперта

admin

Как нейросеть помогает писать курсовые без паники

Alex Matk