После разговора или прогулки в телефоне остаётся запись с полезными подробностями, и ради одной фразы приходится снова двигать ползунок. С расшифровкой проще найти нужное слово, скопировать цитату и вернуться к тому месту, где мысль звучала целиком.

Для обработки записи на компьютере подходит Whisper. Ниже настроим программу на macOS или Windows, получим текстовый файл и сверим детали по звуку. Я бы начинал с короткой собственной заметки, ведь на знакомом содержании сразу видно, пригодился ли результат.

Что понадобится для локальной расшифровки

Whisper распознаёт речь и записывает услышанное в текст. В этой инструкции используем открытую программу OpenAI, которую запускают командой в терминале. Терминал здесь нужен только для установки и запуска; для каждой новой записи достаточно повторить команду с другим именем файла.

Для начала понадобятся Python, программа ffmpeg для чтения аудио и сам Whisper. Ещё нужен набор файлов модели, то есть той части программы, которая распознаёт речь. Его скачиваем при первом запуске, пока есть интернет. Дальше ту же модель можно использовать с локальными записями без подключения к сети. Это устройство видно в загрузчике модели Whisper.

Для русской речи возьмём многоязычную модель small. В названии модели оставляем именно small, поскольку вариант small.en предназначен для английского. Выбор и зависимости описаны в официальном README Whisper. Скорость работы будет зависеть от компьютера и записи, поэтому первый короткий файл поможет понять, удобно ли пользоваться этим способом.

Если сейчас нужен текст одного голосового сообщения и устанавливать программы неудобно, подходящий вариант есть в сравнении способов расшифровки. Здесь продолжаем подготовку компьютера для локальной работы.

Установите программы для своей системы

Выберите только подраздел с нужной ОС. Команды вставляйте по одной и дожидайтесь окончания каждой. Когда снова появится строка для ввода команды, переходите дальше; при сообщении об ошибке сначала разберитесь с ним по разделу вопросов в конце статьи.

macOS

Откройте приложение «Терминал» через поиск Spotlight. Для установки используем Homebrew, средство, которое скачивает программы по их названиям. Если команда brew --version выдаёт command not found, установите Homebrew по официальной инструкции, затем выполните напечатанные установщиком команды из блока Next steps и снова откройте терминал. Поддерживаемые версии macOS и требования к компьютеру перечислены в документации Homebrew; сверьте их перед установкой.

В терминале выполните команды, которые подготовят Python и ffmpeg, а затем создадут рабочую папку в домашнем каталоге.

brew install python@3.11 ffmpeg
python3.11 --version
ffmpeg -version
mkdir -p ~/whisper-work
cd ~/whisper-work
python3.11 -m venv .venv
.venv/bin/python -m pip install -U openai-whisper
.venv/bin/whisper --help

После команд проверки должны появиться версии Python и ffmpeg, а в конце список параметров Whisper. Python 3.11 выбран из диапазона совместимости в README; формула Homebrew устанавливает его отдельно от других версий.

Папка .venv хранит зависимости Whisper отдельно от остальных Python-программ. Такой способ описан в руководстве Python о виртуальных окружениях. Во всех командах ниже указываем путь к программе внутри этой папки, поэтому дополнительная команда активации окружения здесь лишняя.

Windows

Откройте меню «Пуск», найдите PowerShell и запустите его обычным способом. Установите Python Install Manager с официальной страницы Python, откройте новое окно PowerShell и выполните команду установки выбранной версии.

pymanager install 3.11
py -3.11 --version

Команды менеджера и выбор версии описаны в официальном руководстве для Windows. Далее потребуется Scoop, средство установки программ для Windows. Если его ещё нет, выполните шаги Install на официальной странице Scoop в обычном PowerShell, затем заново откройте окно. Проверка scoop --version должна вывести версию Scoop.

Теперь установите ffmpeg и подготовьте папку Whisper в домашнем каталоге пользователя.

scoop install ffmpeg
ffmpeg -version
New-Item -ItemType Directory -Force -Path "$env:USERPROFILE\whisper-work"
Set-Location "$env:USERPROFILE\whisper-work"
py -3.11 -m venv .venv
.\.venv\Scripts\python.exe -m pip install -U openai-whisper
.\.venv\Scripts\whisper.exe --help

В конце должен появиться список параметров Whisper. Программы запускаем прямо из .venv\Scripts, без отдельной активации окружения и изменения политики PowerShell.

Подготовьте запись для первой попытки

Для начала подойдёт короткое аудио в WAV или MP3. Программа читает звук через ffmpeg, так что специально превращать готовый MP3 в WAV для этой команды обычно незачем. Чтение аудиофайла реализовано именно таким способом.

Скопируйте запись в созданную папку whisper-work. На Mac её можно открыть в Finder через «Переход» → «Переход к папке», введя ~/whisper-work; в Windows введите %USERPROFILE%\whisper-work в адресную строку Проводника. Назовите файл recording.wav или recording.mp3, сохранив настоящее расширение. Переименование MP3 в WAV формат файла сохраняет прежним.

При отсутствии готовой записи наговорите в диктофон этот вымышленный пример. Он похож на устные заметки после ремонта велосипеда, из которых позже понадобится составить объявление.

Сегодня забрал велосипед из мастерской на Лесной. Мастер Артём заменил задний тормозной трос и колодки, передние колодки оставил. За работу и детали заплатил две тысячи четыреста рублей. Велосипед складной, колёса двадцать дюймов, рама зелёная. На заднем крыле есть царапина. Перед продажей нужно сфотографировать велосипед сбоку и отдельно показать эту царапину. Старый чек положил в конверт с инструкцией.

В записи есть название улицы, имя, сумма и разные детали ремонта. После расшифровки по тексту будет удобно найти, что заменили, и выбрать фразу о состоянии велосипеда. Для учебной попытки достаточно одного голоса в тихой комнате; длинное интервью успеете обработать следующим файлом.

Запустите Whisper и откройте TXT

В том же окне терминала, находясь в whisper-work, выполните команду для своей системы. Для MP3 замените в ней только recording.wav на recording.mp3.

На macOS команда такая.

.venv/bin/whisper recording.wav --model small --language Russian --task transcribe --device cpu --fp16 False --output_format txt --output_dir out

В Windows используйте этот вариант.

.\.venv\Scripts\whisper.exe recording.wav --model small --language Russian --task transcribe --device cpu --fp16 False --output_format txt --output_dir out

Команда указывает файл записи, русскую речь и модель small. Параметр transcribe сохраняет язык речи, txt выбирает обычный текст, а out задаёт папку результата. Для первого запуска явно выбрана работа на процессоре (cpu), с подходящим для этого режима --fp16 False. Так отдельная настройка видеокарты остаётся за пределами первого шага. Эти параметры предусмотрены в исходнике командной строки Whisper.

При первом запуске сначала скачивается модель, потом начинается обработка записи. Дождитесь возврата строки ввода и проверьте, что в выводе отсутствует сообщение о сбое. В рабочей папке откройте out, а в ней файл recording.txt; он называется по имени исходной записи. На Mac его можно прочитать в TextEdit, в Windows в Блокноте. Сохранение TXT описано в коде записи результатов.

При следующей работе снова откройте терминал, перейдите в whisper-work командой cd ~/whisper-work на Mac или Set-Location "$env:USERPROFILE\whisper-work" в Windows, положите туда новое аудио и укажите его имя в команде. Для разных записей выбирайте разные имена, чтобы сохранить отдельные текстовые файлы.

Проверьте детали, которые пойдут в дальнейшую работу

Откройте аудио рядом с текстом и прослушайте запись целиком. Даже гладко написанная фраза может расходиться с произнесённой, особенно в именах, числах и коротких уточнениях. В карточке модели Whisper отдельно отмечены ошибки распознавания и возможность получить текст, которого в речи вовсе нет.

Я бы сначала проверил те места, на которые затем будет опираться объявление. Для нашего примера полезна такая таблица.

Что ищем в расшифровке Что прозвучало в примере Зачем сверять по записи
Имя и место Мастер Артём, мастерская на Лесной При поиске сведений о ремонте понадобятся верные имена
Сумма 2400 рублей за работу и детали Эту сумму легко ошибочно принять за цену самого велосипеда
Какие детали заменены Задний трос и колодки, передние колодки оставлены В объявлении нужно точно описать выполненный ремонт
Характеристики Складной велосипед, колёса 20 дюймов, зелёная рама Размер и устройство пригодятся будущему покупателю
Состояние Царапина на заднем крыле Для объявления понадобится текст и отдельная фотография дефекта
Что сделать дальше Снять велосипед сбоку и показать царапину Из заметки получается понятное задание для съёмки

Таблица содержит сведения из вымышленной записи, которые нужно найти в полученном тексте. Ответ Whisper может отличаться по пунктуации и написанию чисел; проверяем, сохранился ли смысл. Сомнительное место прослушайте ещё раз и исправьте по звуку. Если слова разобрать трудно, отметьте [неразборчиво], чтобы позже вернуться к этому фрагменту.

Исходную расшифровку оставьте в recording.txt, а исправленную копию сохраните рядом как recording-checked.txt. Из неё уже можно взять фразу для объявления. Например, после проверки нашей вымышленной записи можно написать «Заменены задний тормозной трос и колодки; на заднем крыле есть царапина».

Когда понадобится выделить из более длинной записи договорённости и дела, пригодится разбор расшифровки в заметки. Полный проверенный текст сохраните рядом с аудио, чтобы при вопросах вернуться к словам говорящего.

Вопросы и ответы

Когда получится работать без интернета?

После установки зависимостей и успешного скачивания выбранной модели. Перед поездкой обработайте короткую запись с --model small, затем отключите интернет и повторите ту же команду с другим коротким файлом. Модель хранится на компьютере; смена small на ещё отсутствующую модель потребует нового скачивания. Выбирайте рабочую папку вне облачной синхронизации, если аудио и текст должны оставаться только на устройстве.

Нужен ли платный аккаунт OpenAI или ключ API?

Для описанного локального способа аккаунт и ключ API не нужны. Здесь установлена открытая программа Whisper с весами модели под лицензией MIT. Условия облачных сервисов, использующих название Whisper, относятся к их собственным услугам.

Почему обработка занимает долгое время?

В команде выбран процессор компьютера, и скорость зависит от оборудования, длительности и содержания записи. Для первой оценки используйте короткое аудио. Если small работает слишком медленно, попробуйте заменить её на base; эта модель меньше, а пригодность полученного текста снова проверьте по звуку. Время обработки чужого компьютера для расчёта ожидания здесь бесполезно.

Что делать, если программа пишет об отсутствии файла или ffmpeg?

Сначала проверьте рабочую папку и точное имя аудио, включая расширение. Путь с пробелами заключите в двойные кавычки. При ошибке ffmpeg выполните ffmpeg -version; если команда отсутствует, вернитесь к её установке для выбранной ОС и откройте новое окно терминала. Ошибка до обработки записи требует исправления установки или пути к файлу.

Что делать при ошибке установки openai-whisper?

Сохраните полный текст ошибки и проверьте выбранную версию Python. В разделе Setup описаны случаи, когда требуется Rust, и отдельная ошибка No module named 'setuptools_rust'. Для последней предусмотрена установка пакета setuptools-rust тем же Python из .venv. Остальные сообщения разбирайте по их тексту, поскольку случайная переустановка всего набора лишь усложнит поиск причины.

Получится ли сразу разделить текст по собеседникам?

В этом способе получите сплошную расшифровку. TXT сохраняет распознанную речь без подписей говорящих. Для интервью расставьте подписи по аудио вручную; смена формата на субтитры сама по себе говорящих тоже не определит.

От одной записи к повторяющейся практике

После первой попытки в папке останутся аудио, исходная расшифровка и исправленный текст. С этим результатом удобно продолжать работу, например собрать из устных заметок объявление или найти нужные фразы для статьи.

В практике работы с документами «Первопроходцев» можно продолжить осваивать ИИ на собственных задачах, задавать вопросы и получать ручную проверку проектных работ. Уроки открываются постепенно, эфиры проходят раз в две недели; участие стоит 3570 рублей за 31 день. Начните с записи, к которой обычно возвращаетесь ради одной детали, и сохраните её проверенный текст рядом с аудио.