Что помогает
Один микрофон посередине стола, люди не перебивают друг друга, голоса заметно разные. В таких условиях реплики раскладываются почти без ошибок.
Диктофонная запись отличается от голосового сообщения тремя вещами: она длинная, на ней часто несколько человек, и качество бывает любым. Разбираем, как достать файл с любого устройства и получить читаемый текст.
Первая половина задачи — вытащить запись с устройства. Дальше всё одинаково, независимо от того, чем записывали.
| Откуда запись | Формат | Как достать |
|---|---|---|
| iPhone, «Диктофон» | M4A | Открыть запись → «Поделиться» → «Сохранить в Файлы» либо отправить себе в мессенджер. Через iCloud Drive запись видна и на компьютере |
| Android, штатный диктофон | M4A, реже 3GP | Записи лежат в папке Recordings или Sounds. Проще всего подключить телефон кабелем и скопировать |
| Старые телефоны и звонки | AMR | Формат древний и сильно сжатый. Распознаётся, но точность ниже: в нём мало высоких частот |
| Отдельный диктофон | WAV, MP3 | Подключить кабелем или вынуть карту памяти. WAV — лучший вариант из всех: сжатия нет вовсе |
| Запись звонка приложением | M4A, MP3 | Файлы обычно лежат в собственной папке приложения; там же настраивается качество |
| Видео с камеры или созвона | MP4, MKV | Звук извлекать не нужно, видеофайл распознаётся напрямую. Видео в текст |
Интервью, совещание, приём — это всегда два и больше голосов, и сплошная простыня текста без разметки почти бесполезна. Разделение по говорящим разбивает расшифровку на реплики и подписывает их: «Говорящий 1», «Говорящий 2».
Точность разделения зависит не от программы, а от записи:
Один микрофон посередине стола, люди не перебивают друг друга, голоса заметно разные. В таких условиях реплики раскладываются почти без ошибок.
Наложение голосов, эхо в пустой комнате, телефон в кармане, похожие голоса. Здесь ошибается любой алгоритм, включая облачные.
Положить телефон ближе к тому, кто говорит тише. Одна минута тишины в начале записи заметно облегчает разбор.
Переименовать говорящих в расшифровке: имена читаются лучше номеров, а искать по тексту становится проще.
Разделение говорящих в Dictator считает ваш компьютер — как и само распознавание. Запись при этом никуда не отправляется.
Ответ зависит от того, где считается расшифровка.
На видеокарте локальное распознавание идёт быстрее реального времени: час записи обрабатывается за считаные минуты. На процессоре медленнее, зато ничего не ждёт очереди на чужом сервере и не считает минуты. Ограничение одно — длительность одного файла: 30 минут на бесплатном тарифе, 90 минут на Basic, 4 часа на Pro и без ограничения на Premium. Число файлов не ограничено ни на одном тарифе, поэтому запись длиннее предела делится на части заранее, любым аудиоредактором.
Плохая запись — это не приговор, но и не повод ждать чуда. Что реально помогает:
В настройках распознавания есть выбор размера модели. На шумной записи разница между лёгкой и тяжёлой моделью заметнее всего.
На шумной записи автоопределение языка ошибается чаще. Если язык известен, лучше задать его сразу.
Фамилии, названия компаний и термины распознаются хуже обычных слов. Собственный словарь снимает большую часть таких ошибок.
Записи телефонных звонков в старом формате физически лишены части частот. Текст получится, но с ошибками, и это ограничение записи, а не программы.
Диктофонная запись — это чаще всего чужой голос: интервью, приём, встреча, разговор с клиентом. Онлайн-сервисы устроены так, что файл нужно загрузить на их сервер, и это не всегда допустимо: договор о конфиденциальности, врачебная тайна, адвокатская тайна, внутренние правила компании.
Локальное распознавание снимает вопрос целиком: файл остаётся на диске, интернет не нужен, а месячной квоты минут не существует, потому что считать нечего — работу делает ваше железо. Разбор — на странице про расшифровку.
Открыть запись в «Диктофоне» → «Поделиться» → «Сохранить в Файлы» либо отправить себе в мессенджер. Если включён iCloud Drive, файл появится на компьютере сам. Формат будет M4A, конвертировать его не нужно.
Все распространённые: M4A, MP3, WAV, OGG, AMR, а также видеофайлы MP4 и MKV — из них звук берётся автоматически.
Нет. M4A распознаётся напрямую, а конвертация только съедает качество и время.
Да, реплики разбиваются по говорящим и подписываются номерами, которые потом можно переименовать. Точность зависит от записи: наложение голосов и эхо мешают любому алгоритму.
На видеокарте — быстрее реального времени, то есть считаные минуты. На процессоре дольше, но без очереди на чужом сервере и без счётчика минут.
Ограничена длительность одного файла: 30 минут на бесплатном тарифе, 90 минут на Basic, 4 часа на Pro, без ограничения на Premium. Число файлов не ограничено, и месячного лимита минут у локального распознавания нет.
В локальном режиме — нет, файл не покидает диск и интернет не требуется. Облачное распознавание есть отдельно, для случаев, когда своего железа не хватает, и включается вручную.
Да, расшифровка разбивается по времени, и по ней можно искать. Это удобнее сплошного текста, когда запись длинная и к ней придётся возвращаться.
Первые минуты расшифруются бесплатно, без регистрации и без загрузки в облако.
Открыть расшифровкуОпубликовано