Новости компаний 0+

Российские технологии голосовой биометрии продемонстрировали выдающиеся результаты в конкурсе NIST

Группа компаний ЦРТ (входит в экосистему Сбера) показала выдающиеся результаты в тестировании голосовой биометрии — алгоритмов распознавания человека по голосу — Национальным институтом стандартов и технологий США (NIST).

Технология группы компаний ЦРТ показала выдающийся результат в конкурсе NIST SRE21 (Speaker Recognition Evaluation). В конкурсе решалось несколько задач:

    — распознавание говорящего по аудио разных источников: телефонных звонков и звука из видео . Для решения использовался алгоритм распознавания человека по голосу;

    — распознавание говорящего по аудио и видео из разных источников: телефонных звонков, звука из видео и просто видео. Для решения использовалась комбинация алгоритмов распознавания человека по голосу и по лицу.

Особенность конкурса в этом году — два варианта обучения алгоритмов: вариант Fixed допускал использование только звуковых данных от организаторов. Вариант Open допускал использование любых данных. Сложность заключалась в том, что данные записывались как через телефон (обычные телефонные разговоры), так и в микрофонном канале (записи с видеокамер), а люди на записях разговаривали на различных языках.

Научная команда ЦРТ для решения задачи распознавания человека одна из первых успешно применила комбинацию архитектур нейронных сетей типа transformer, которая популярна в задачах компьютерного зрения, понимания естественного языка, и wav2vec, которая применяется в задачах распознавания речи. Такой подход позволил достичь низкого уровня ошибки верификации человека по голосу. 

Также команда группы ЦРТ принимает участие в еще одном конкурсе — NIST CTS Speaker Recognition Challenge. Это конкурс в формате ongoing: соревнования длятся нон-стоп, периодически подводятся промежуточные результаты. В этом соревновании команда группы ЦРТ также демонстрирует высокие результаты. Основная задача CTS Challenge — распознать говорящего по записям в телефонном канале, при этом человек может говорить на разных языках — английском, французском, арабском, и с разных моделей смартфонов. В соревновании принимают участие 33 команды из ведущих университетов и коммерческих компаний.

Автор: Игорь Сергеев