MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
IT Meeting - митапы и конференции по разработке

31 Jul, 14:05

Открыть в Max Поделиться

Voice AI Dev Meetup #1: голосовые технологии в продакшене

1. Перебей меня, если сможешь: подводные камни перебиваний в голосовом агенте — Евгения Заворина, Voice Engineering Lead, Bitmanager ai
Как голосовой агент понимает, что его перебили и нужно ли на это реагировать? Не менее остро стоит вопрос с потерей контекста, который агент не успел произнести. На реальных сценариях разберём, как это влияет на естественность диалога и где заканчивается ML и начинается продуктовая логика.

2. Твой ход: как мы учили модель понимать смену хода в диалоге — Кирилл Бородин, Voice Engineer, Bitmanager ai
Как построить точную и быструю модель определения конца реплики в живом диалоге? Отдельно остановимся на решениях, которые дали наибольший прирост качества, поговорим про неоднозначные backchannel-сигналы и подготовку данных из реальных разговоров.

3. Как мы построили крупнейшую в России открытую полноцикловую экосистему речевого антиспуфинга — Максим Маслов, Senior Voice Engineer, VK R&D
Можно ли построить универсальный детектор голосовых дипфейков, который работает на разных языках, датасетах и типах атак? На результатах масштабного тестирования покажем, почему существующие решения обобщаются хуже, чем принято считать, и как системная работа с моделями, данными и протоколами оценки приближает к действительно универсальному детектору.

4. ESpeech: открытый русский TTS на трёх 4090, от датасета до синтеза с клонированием голоса — Денис Петров, Voice ML Research Engineer, MWS AI
Открытых русских TTS стало много, но почти все они не заточены в первую очередь под русский: язык там идёт довеском к английскому или китайскому. Расскажем, как делаем ESpeech, где русский стоит на первом месте. Пройдём по стеку: пайплайн обработки данных и его масштабирование от первых 50 000 часов сырого аудио до гораздо больших объёмов, наш аудиокодек ECodec, обучение моделей.

➖➖➖

🗓 10 августа, 19:00–22:00 мск, Понедельник

📍 ОФЛАЙН, Москва

✅ Регистрация на мероприятие

126 2
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat