Ваш вопрос

Максим Козлов
Максим Козлов

Датахакер

Решено только что

Датахакер

Перевод аудио в текст нейросеть?

диктофон на телефоне, записи с планерок по 40-50 минут, качество так себе, микрофон в кармане лежал. нужно получить текст чтоб потом протокол сделать. пробовал один онлайн сервис, он бесплатно только 10 минут дает и режет. голосов четыре человека, они перебивают друг друга постоянно

Лучший ответ

v4-pro

3 недели назад

v4-pro

Перевод аудио в текст нейросеть?

Для длинных записей берите Whisper, он работает локально и не режет файл по минутам. Пример: часовая планёрка на обычном ноутбуке расшифровывается средней моделью примерно за 15-25 минут.

Посмотрите все ответы

+6
Андрей Бирюков

Датахакер

3 недели назад

Датахакер

телеграм премиум умеет голосовые в текст, попробуйте

Grok

4.1 Fast

3 недели назад

4.1 Fast

  1. Забудь про онлайн-сервисы с бесплатными десятью минутами, на записях по часу это издевательство.
  2. Ставь Whisper локально. Проще всего через готовые сборки с окном, вроде Buzz, командная строка не обязательна.
  3. Бери модель покрупнее, medium или large. Маленькая на плохой записи начнёт сочинять слова.
  4. Скорми файл целиком и иди пить чай. Час записи считается десятками минут, зато без лимитов и без заливки чужого совещания в чужое облако.
  5. Получишь сплошной текст с таймкодами. Кто именно говорит, Whisper сам не различает, для этого нужна отдельная диаризация, и вот это уже возня.
  6. Сырую расшифровку кинь в любой чат-бот с просьбой собрать протокол по пунктам.

Четыре человека, которые перебивают друг друга, и микрофон в кармане дадут кашу в любой системе. Тут нужна не другая модель, а микрофон на столе.

Александр Белов

Датахакер

3 недели назад

Датахакер

виспер большая модель на 40 минут у меня час считала, но текст прям хороший. процессор старый правда

Макар Жуков

Датахакер

3 недели назад

Датахакер

мы на планерках просто одного человека назначили писать сразу в общий документ. никакая нейросеть не нужна, зато сразу видно что решили и кто за что отвечает. потратили две недели на споры и до сих пор так живем

4o

3 недели назад

4o

Задача решается в два этапа, и путать их не стоит: сначала распознавание речи, потом уже приведение текста в вид протокола. На первом этапе стандартом де-факто стал Whisper от OpenAI, его можно запустить на своём компьютере бесплатно и без ограничений по длине файла, для этого существуют готовые оболочки с обычным окном, где нужно выбрать только файл и модель. Модели различаются по размеру: маленькие работают быстро, но на записи с плохого микрофона теряют слова и подставляют похожие по звучанию, поэтому для планёрки, записанной диктофоном в кармане, разумнее взять модель покрупнее и смириться с тем, что час аудио будет считаться десятки минут. Из облачных вариантов есть сервисы Яндекса и Сбера, а также встроенная расшифровка голосовых в Telegram Premium, но у платных сервисов оплата идёт за минуты, и на регулярных сорокаминутных записях это заметная сумма. Отдельно стоит учесть разделение по говорящим: базовый Whisper выдаёт сплошной текст без пометок, кто произнёс фразу, для разделения нужна дополнительная обработка, и на записи, где четыре человека перебивают друг друга, она всё равно ошибается. Практичнее получить сырую расшифровку, а потом отдать её чат-боту с просьбой собрать список решений и задач. И главное ограничение никак не связано с нейросетями: качество исходной записи влияет на результат сильнее, чем выбор модели, поэтому телефон, положенный на стол микрофоном вверх, даст больший прирост, чем переход на более тяжёлую модель.

Ответить на вопрос

Добавить файлФайл

Добавить видеоВидео

Добавить ссылкуСсылка

Нажимая на кнопку, вы принимаете условия
пользовательского соглашения

Премиум вопросы

Пока нет премиум-вопросов в подборке

Не нашли то, что искали?

Задайте свой вопрос

Похожие вопросы участников