Рубрика «распознавание речи»

Хотел сделать конкурс на Новый год

К Новому году мы с друзьями договорились, что каждый подготовит по конкурсу. Мне хотелось сделать что‑нибудь музыкальное, а идеи нашлись в воспоминаниях о двух корпоративах: с одного я принёс желание сочинить песню для нашей компании, с другого позаимствовал механику конкурса. Так появилась What The Track, в которой нужно угадать последнее слово оборванной строки песни.

Читать полностью »

Я хотел сделать дочери робота помощника с локальным ИИ, чтоб она не отвлекалась от уроков, а наоборот увлеченно их делала.

Но ничего для этого у меня не было. Была только идея: сделать для дочери робота, с которым можно разговаривать даже без интернета. И хотелось, чтобы он не выглядел просто очередной колонкой с часами или черным лицом с синими глазами. Поэтому первым делом я сделал на ПК анимированное лицо — обычное роботическое, без волос, банта и прочих украшений, хотелось что-то привлекательное.

Показал дочери. Она посмотрела и спросила: «А можно, чтобы это была аниме-кошечка?»

Читать полностью »

Я снимаю рилсы с телефоном в руке и хотел суфлёр, который сам прокручивает текст, пока я говорю, причём поверх Instagram, TikTok или системной камеры, а не в собственном рекордере. Самым трудным оказалось не распознавание речи, а микрофон: во время записи видео Android отдаёт его камере.

Читать полностью »

Я один пишу расширение Chrome, которое показывает субтитры с переводом поверх созвона в Meet, Zoom или Teams, открытых во вкладке браузера. В звонок при этом никто не заходит, звук берётся из вкладки. Ниже три вещи, на которых ушло больше всего времени. Цифры на 17 сентября 2026.

Звук вкладки в Manifest V3

В MV3 фон расширения это service worker, а в нём нет ни Web Audio, ни getUserMedia. Поэтому service worker получает не поток, а только идентификатор, и создаёт offscreen-документ (reasons: ['USER_MEDIA']), невидимую страницу, где эти API есть:

Читать полностью »

Случайно услышал на просторах интернета, что у Сбера, оказывается, есть открытая модель, которая по бенчмаркам русского языка бьёт Whisper, проверил, и понял, что она не просто не хуже, она работает мгновенно да еще и на обычном процессоре, без GPU, а текст появляется быстрее, чем успеваешь отпустить кнопку

Дальше понеслось, собрал диктовку для себя, раздал друзьям, всем понравилось, начали пользоваться, и разумеется, повалились хотелки, а давай сделаем это, а пусть оно ещё вот так, из этого за пару недель вырос целый продукт.

Что получилось и как работает:

Читать полностью »

Все голосовые платформы решают, что человек договорил, по таймеру тишины. Я замерил, во что это выливается на живой русской речи, и получил цифру, которая меня удивила: из 1275 мс задержки перед ответом 1200 мс — это ожидание секундомера, и только 75 мс — работа самой модели.

Ниже — методика, замеры и решение, которое даёт 316 мс вместо 1200 при двух обрывах вместо тридцати восьми. Всё воспроизводимо, детектор — на правилах, без обучения и без GPU.

Проблема: тишина — плохой признак конца мысли

Читать полностью »

Существующие решения для диктовки текста меня не устраивали по одной и той же причине: голос уходит на чужой сервер, а за это ещё и просят подписку. Wispr Flow, Blabby, встроенный Win+H — всё либо в облаке, либо работает так, что проще напечатать.

Хотелось простого: нажал хоткей, сказал, нажал ещё раз — текст появился в том поле, где стоял курсор. Хоть в браузере, хоть в IDE, хоть в мессенджере. Локально. Бесплатно. Без прав администратора.

Получился WhisperType — MIT, Windows 10/11 x64, ~250 МБ после установки плюс 1.6 ГБ модели. Актуальная версия — 1.3.1Читать полностью »

Диктовка: запись, распознавание, текст в буфере

Диктовка: запись, распознавание, текст в буфере

⬇ Скачать для WindowsЧитать полностью »

Я хотел получить на Mac простую вещь: нажать глобальную горячую клавишу, надиктовать сообщение и сразу увидеть текст в активном окне. Без отправки аудио в облако, без ежемесячной подписки и с возможностью самому сравнить несколько моделей на собственной речи.

Так появился VoiceSwitch — открытое menu bar-приложение для Apple Silicon. Сейчас оно умеет переключаться между четырьмя движками распознавания, показывать состояние записи и расшифровки, автоматически вставлять результат и локально превращать устную речь в аккуратное или краткое сообщение.

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js