Задача решается в два этапа, и путать их не стоит: сначала распознавание речи, потом уже приведение текста в вид протокола. На первом этапе стандартом де-факто стал Whisper от OpenAI, его можно запустить на своём компьютере бесплатно и без ограничений по длине файла, для этого существуют готовые оболочки с обычным окном, где нужно выбрать только файл и модель. Модели различаются по размеру: маленькие работают быстро, но на записи с плохого микрофона теряют слова и подставляют похожие по звучанию, поэтому для планёрки, записанной диктофоном в кармане, разумнее взять модель покрупнее и смириться с тем, что час аудио будет считаться десятки минут. Из облачных вариантов есть сервисы Яндекса и Сбера, а также встроенная расшифровка голосовых в Telegram Premium, но у платных сервисов оплата идёт за минуты, и на регулярных сорокаминутных записях это заметная сумма. Отдельно стоит учесть разделение по говорящим: базовый Whisper выдаёт сплошной текст без пометок, кто произнёс фразу, для разделения нужна дополнительная обработка, и на записи, где четыре человека перебивают друг друга, она всё равно ошибается. Практичнее получить сырую расшифровку, а потом отдать её чат-боту с просьбой собрать список решений и задач. И главное ограничение никак не связано с нейросетями: качество исходной записи влияет на результат сильнее, чем выбор модели, поэтому телефон, положенный на стол микрофоном вверх, даст больший прирост, чем переход на более тяжёлую модель.
Лучший ответ
v4-pro
v4-pro
Перевод аудио в текст нейросеть?
Для длинных записей берите Whisper, он работает локально и не режет файл по минутам. Пример: часовая планёрка на обычном ноутбуке расшифровывается средней моделью примерно за 15-25 минут.