Рубрика «транскрибация»

После рабочих встреч часто остаются записи. В моем случае это записи Яндекс Телемоста.

Запись есть, но пользоваться ей не всегда удобно. Если нужно что‑то вспомнить, приходится открывать видео, перематывать, искать нужный кусок, переслушивать. Если нужно передать встречу другому человеку, одного видео обычно мало.

У меня часто бывает такой сценарий: нужно передать программисту контекст по задаче. Можно скинуть запись встречи и написать: «посмотри, пожалуйста». Но человеку придется самому смотреть видео, искать важные места, понимать, где обсуждение, где решение, где задача.

Читать полностью »

Это простой способ транскрибации любого аудио или видео. Бесплатно (нужен Windows + Google аккаунт) и без ограничений (подразумевается использования для личных задач на уровне 100 видео в день).

Раньше я пользовался Otter и Descript. Они платные (10–30$/месяц) + есть лимиты — 600 минут в месяц, 90 минут за раз.

Короче, внедряйте и пользуйтесь.

Подготовка

Переходим в папку C:Users[имя пользователя]Downloads или «Загрузки» (где [имя пользователя] это ваш логин, под которым вы входите в Windows).

Например, ваш вариант C:UserspetiaDownloads или C:UserskatiaDownloads

Создаём в папке «Загрузки» папку «audio».

Переходим на Гитхаб проекта Читать полностью »

Azio-Speech.png

Azio-Speech.png

Предисловие: зачем вообще это нужно

Читать полностью »

У многих из нас есть «кладбище» аудиозаписей: интервью, лекции, длинные совещания. Когда мой архив перевалил за сотню часов, я понял, что пора что-то менять. Облачные сервисы либо кусаются по цене, либо выдают «кашу» без нормальной пунктуации и разделения спикеров.

В этой статье я расскажу, как собрал локальный конвейер на базе WhisperX, почему 40 ГБ оперативной памяти важнее мощной видеокарты и как метод «вайб-кодинга» помог мне превратить одиночный скрипт в модульное приложение с пакетной обработкой.

Почему не ванильный Whisper?

Оригинальный Whisper от OpenAI хорош, но для моих задач у него было три фатальных недостатка:

  1. Читать полностью »
Как я решил проблему длинных совещаний вайбкодингом и китайской видеокартой - 1

Еще одна статья про whisper + pyannote для транскрибации совещаний? Да, но нет.

Читать полностью »

I. Первые шаги: листок, стенография и диктофон

В середине XX века к протоколированию добавился диктофон. Уже не надо было все ловить «на лету» — можно записать разговор и потом «разложить» записи в текст. Но диктофон имел слабое место: качество записи, шум, шепоты, пересекающиеся голоса — всё это мешало точности. К тому же, никто не может слушать три часа записи без усталости — и всё равно надо вручную транскрибировать, выбирать, что важно.

Но технология, решая одну проблему, тут же создала другую. Часовые записи становились «цифровым кладбищемЧитать полностью »

Топ моделей для контента - 1

В последние годы генеративные нейросети стали не просто трендом, а полноценным инструментом для создания контента. Текст, изображения, аудио и даже видео — всё это можно сгенерировать с помощью моделей искусственного интеллектаЧитать полностью »

OpenAI взимает оплату поминутно, так что сделаем минуты короче - 1

Хотите ускорить и удешевить транскрибации OpenAI? Просто повысьте скорость аудио.

Я имею в виду буквально. Перед транскрибацией увеличьте скорость аудио в два или в три раза в Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js