Рубрика «синтез речи»

Я хотел сделать дочери робота помощника с локальным ИИ, чтоб она не отвлекалась от уроков, а наоборот увлеченно их делала.

Но ничего для этого у меня не было. Была только идея: сделать для дочери робота, с которым можно разговаривать даже без интернета. И хотелось, чтобы он не выглядел просто очередной колонкой с часами или черным лицом с синими глазами. Поэтому первым делом я сделал на ПК анимированное лицо — обычное роботическое, без волос, банта и прочих украшений, хотелось что-то привлекательное.

Показал дочери. Она посмотрела и спросила: «А можно, чтобы это была аниме-кошечка?»

Читать полностью »

Мы с женой хотели вместе поиграть в Split Fiction на PS5. Но с английским у нас обоих не очень: понимать диалоги на слух трудно, а хочется следить за историей и слышать реплики на понятном нам языке.

Так появилась идея: пусть MacBook читает игровые субтитры по-русски, пока мы играем на телевизоре. С этого и начался проект.

К телевизору уже была подключена карта видеозахвата с HDMI-входом, HDMI-выходом и USB. Оставалось получить картинку на MacBook, вырезать нижнюю треть экрана, распознать текст и прочитать его вслух. Главное — не повторять одну реплику всё время, пока она висит на экране.

Читать полностью »

Все голосовые платформы решают, что человек договорил, по таймеру тишины. Я замерил, во что это выливается на живой русской речи, и получил цифру, которая меня удивила: из 1275 мс задержки перед ответом 1200 мс — это ожидание секундомера, и только 75 мс — работа самой модели.

Ниже — методика, замеры и решение, которое даёт 316 мс вместо 1200 при двух обрывах вместо тридцати восьми. Всё воспроизводимо, детектор — на правилах, без обучения и без GPU.

Проблема: тишина — плохой признак конца мысли

Читать полностью »

У нас было несколько обучающих видео по личному кабинету. После большого редизайна большая часть стала неактуальной: кнопки переехали, разделы переименовали, один экран вообще уехал в другое меню.

Чтобы обновить одно видео, надо открыть OBS, поднять чистый профиль браузера — иначе в кадр лезут закладки и всплывашки. Потом записать дубль, в котором ты ни разу не промахнулся мышкой. Потом порезать в редакторе, наложить подписи. На семь видео уходит день. Через два месяца — опять день.

Предсказуемо, видео перестали обновлять.

Читать полностью »

Голоса в компьютере: игры начинают петь - 1

Продолжаем вспоминать технологические чудеса в области звука в компьютерных играх — обыденные ныне вещи, первая встреча с которыми в нашей жизни некогда поразила воображение тем, что такое в принципе возможно.

В прошлый разЧитать полностью »

Всем привет! Команда Qwen от Alibaba выложила в открытый доступ Qwen3-TTS — нейросетевую модель для синтеза речи с клонированием голоса. Сегодня хочу рассказать об этой технологии подробнее и поделиться портативной версией.

Читать полностью »
Наш синтез для 20 языков теперь работает локально под Windows как экранная читалка (SAPI5) и в Балаболке - 1

Всё шло к этому. Мы решилиЧитать полностью »

Привет! В продолжение моей предыдущей статьи о локальном переводчике на кабардинском языке хочу поделиться практическим опытом обучения моделей машинного перевода для низкоресурсных языков. Расскажу о том, с какими проблемами я столкнулся, как их решал, и покажу конкретный код, который помог улучшить качество перевода с BLEU 8 до 28 пунктов.

Введение: три кита обучения переводчиков

Обучение моделей перевода - нетривиальная задача, которая опирается на три ключевых элемента:

1. Корпус параллельных текстов

Читать полностью »

Дружба народов здорового человека

Дружба народов здорового человека

Наконец-то представляем наш синтез для языков России и СНГ. В этот раз получилось покрыть 20 языков, всего 95 голосов. От старой демки этот релиз отличается следующим:


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js