Рубрика «распознавание речи»

Все голосовые платформы решают, что человек договорил, по таймеру тишины. Я замерил, во что это выливается на живой русской речи, и получил цифру, которая меня удивила: из 1275 мс задержки перед ответом 1200 мс — это ожидание секундомера, и только 75 мс — работа самой модели.

Ниже — методика, замеры и решение, которое даёт 316 мс вместо 1200 при двух обрывах вместо тридцати восьми. Всё воспроизводимо, детектор — на правилах, без обучения и без GPU.

Проблема: тишина — плохой признак конца мысли

Читать полностью »

Существующие решения для диктовки текста меня не устраивали по одной и той же причине: голос уходит на чужой сервер, а за это ещё и просят подписку. Wispr Flow, Blabby, встроенный Win+H — всё либо в облаке, либо работает так, что проще напечатать.

Хотелось простого: нажал хоткей, сказал, нажал ещё раз — текст появился в том поле, где стоял курсор. Хоть в браузере, хоть в IDE, хоть в мессенджере. Локально. Бесплатно. Без прав администратора.

Получился WhisperType — MIT, Windows 10/11 x64, ~250 МБ после установки плюс 1.6 ГБ модели. Актуальная версия — 1.3.1Читать полностью »

Диктовка: запись, распознавание, текст в буфере

Диктовка: запись, распознавание, текст в буфере

Скачать для WindowsЧитать полностью »

Я хотел получить на Mac простую вещь: нажать глобальную горячую клавишу, надиктовать сообщение и сразу увидеть текст в активном окне. Без отправки аудио в облако, без ежемесячной подписки и с возможностью самому сравнить несколько моделей на собственной речи.

Так появился VoiceSwitch — открытое menu bar-приложение для Apple Silicon. Сейчас оно умеет переключаться между четырьмя движками распознавания, показывать состояние записи и расшифровки, автоматически вставлять результат и локально превращать устную речь в аккуратное или краткое сообщение.

Читать полностью »

Я не пишу код каждый день уже много лет, последний продакшен на PHP отгрузил году в 2009. Но за последние годы инструменты дошли до состояния, когда сольный pet‑проект с распознаванием речи на устройстве собирается силами одного человека. Эта статья про то, как я сделал голосовой дневник мыслей для когнитивно‑поведенческой терапии (КПТ), почему распознавание речи у меня крутится прямо на телефоне, и какие на этом пути были технические развилки. Кода почти не будет, будет архитектура и обоснование решений.

Читать полностью »

Azio-Speech.png

Azio-Speech.png

Предисловие: зачем вообще это нужно

Читать полностью »

Вообще-то, я бэкендер последние лет 20, но недавно остался без работы (и AI тут не причём), решил «замутить» свой «стартап», пока ищу новую работу Java-программиста. А заодно подтянуть новые технологии, поглубже изучить немецкий и английский и немного развеяться…

Читать полностью »

Всё началось с того, что пару месяцев назад я сломал левую руку. Печатать одной правой оказалось той ещё пыткой, поэтому я начал искать альтернативы. Ради интереса попробовал встроенную диктовку на Маке, которой отродясь не пользовался. И внезапно обнаружил, что современный голосовой ввод в macOS — это пушка. Он отлично справляется с моим быстрым темпом речи и сложными словами. Я начал диктовать вообще всё: от сообщений в Telegram до рабочих промптов.

А потом я попытался сделать то же самое на Android.

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js