Системы распознавания речи

Содержание

Слайд 2

Что такое распознавание речи?

Распознавание речи – это многоуровневая задача распознавания образов, в

Что такое распознавание речи? Распознавание речи – это многоуровневая задача распознавания образов,
которой акустические сигналы анализируются и структурируются в иерархию структурных элементов (например, фонем), слов, фраз и предложений

Слайд 3

Структура стандартной системы распознавания речи

Структура стандартной системы распознавания речи

Слайд 4

Необработанная речь

Обычно, поток звуковых данных, записанный с высокой дискретизацией (20 КГц при

Необработанная речь Обычно, поток звуковых данных, записанный с высокой дискретизацией (20 КГц
записи с микрофона либо 8 КГц при записи с телефонной линии)

Слайд 5

Анализ сигнала

Поступающий сигнал должен быть изначально трансформирован и сжат, для облегчения последующей

Анализ сигнала Поступающий сигнал должен быть изначально трансформирован и сжат, для облегчения
обработки. Есть различные методы для извлечения полезных параметров и сжатия исходных данных в десятки раз без потери полезной информации. Наиболее используемые методы:
анализ Фурье;
линейное предсказание речи;
кепстральный анализ.

Слайд 6

Речевые кадры

Результатом анализа сигнала является последовательность речевых кадров. Обычно, каждый речевой кадр

Речевые кадры Результатом анализа сигнала является последовательность речевых кадров. Обычно, каждый речевой
– это результат анализа сигнала на небольшом отрезке времени (порядка 10 мс.), содержащий информацию об этом участке (порядка 20 коэффициентов). Для улучшения качества распознавания, в кадры может быть добавлена информация о первой или второй производной значений их коэффициентов для описания динамики изменения речи.

Слайд 7

Речевые кадры

Речевые кадры

Слайд 8

Акустические модели

Для анализа состава речевых кадров требуется набор акустических моделей. Рассмотрим две

Акустические модели Для анализа состава речевых кадров требуется набор акустических моделей. Рассмотрим
наиболее распространенные из них.
Шаблонная модель. 
Модель состояний. 

Слайд 9

Шаблонная модель

В качестве акустической модели выступает каким-либо образом сохраненный пример распознаваемой структурной

Шаблонная модель В качестве акустической модели выступает каким-либо образом сохраненный пример распознаваемой
единицы (слова, команды). Вариативность распознавания такой моделью достигается путем сохранения различных вариантов произношения одного и того же элемента (множество дикторов много раз повторяют одну и ту же команду). Используется, в основном, для распознавания слов как единого целого (командные системы).

Слайд 10

Модель состояний

Каждое слово моделируется как последовательность состояний указывающих набор звуков, которые возможно

Модель состояний Каждое слово моделируется как последовательность состояний указывающих набор звуков, которые
услышать в данном участке слова, основываясь на вероятностных правилах. Этот подход используется в более масштабных системах.

Слайд 11

Акустический анализ

Состоит в сопоставлении различных акустических моделей к каждому кадру речи и

Акустический анализ Состоит в сопоставлении различных акустических моделей к каждому кадру речи
выдает матрицу сопоставления последовательности кадров и множества акустических моделей. Для шаблонной модели, эта матрица представляет собой Евклидово расстояние между шаблонным и распознаваемым кадром. Для моделей, основанных на состоянии, матрица состоит из вероятностей того, что данное состояние может сгенерировать данный кадр.

Слайд 12

Корректировка времени

Используется для обработки временной вариативности, возникающей при произношении слов (например, “растягивание”

Корректировка времени Используется для обработки временной вариативности, возникающей при произношении слов (например, “растягивание” или “съедание” звуков).
или “съедание” звуков).

Слайд 13

Последовательность слов

В результате работы, система распознавания речи выдает последовательность (или несколько возможных

Последовательность слов В результате работы, система распознавания речи выдает последовательность (или несколько
последовательностей) слов, которая, наиболее вероятно, соответствует входному потоку речи.