Intellos Hub
Шаблонv1.0.0бетаготовое приложение

Транскрибация аудио

Чат-приложение переводит аудиозапись в текст встроенным распознаванием речи платформы с моделью whisper-large-v3, без отдельного плагина и ключа стороннего сервиса. MP3, M4A, OGG и WAV; расшифровка выдаётся одной строкой без разбивки по говорящим.

Схема логики

Схема логики: Транскрибация аудио

Как это работает

  1. Сотрудник: Отправляет аудио — запись или файл
  2. Документы: Распознаёт речь — аудио в текст
  3. Сотрудник: Получает текст — расшифровка записи

Транскрибация аудио

Чат-приложение переводит аудиозапись в текст: пользователь прикладывает файл, в ответ получает расшифровку. Распознавание делает встроенный в ядро платформы провайдер речи — отдельный плагин и ключ стороннего сервиса не нужны, модель распознавания берётся из настроек площадки. Решение пригодится делопроизводству для записей совещаний, продажам для разговоров с клиентами и кадрам для собеседований.

Что на входе

  • Аудиофайл, приложенный к сообщению в чате. Проверены MP3, M4A, OGG/Opus и WAV.
  • Формы запуска нет.
  • Настройки загрузки: до трёх файлов на сообщение, предел аудиофайла — 50 МБ. Распознавание рассчитано на одну запись за раз (см. «Ограничения»).

Что на выходе

  • Ответ в чате: расшифровка одной сплошной строкой — без разметки, без разбивки по говорящим и без отметок времени.

Как работает

  1. Пользователь прикладывает запись к сообщению.
  2. Встроенный провайдер речи передаёт файл модели распознавания whisper-large-v3.
  3. Расшифровка выводится в ответ как есть, без обработки языковой моделью.
  4. Если нужен протокол, выжимка, список задач или разделение реплик, за распознаванием ставят отдельный шаг с языковой моделью — в этом решении его нет.

Что настроить после установки

  • Модель распознавания: Настройки → Поставщик моделей → OpenAI-API-compatible — добавить модель openai/whisper-large-v3 с типом «речь в текст», адресом и ключом того сервиса, где она развёрнута.
  • Плагин провайдера langgenius/openai_api_compatible. Это выгрузка с площадки, где он уже стоял, поэтому в списке зависимостей его нет — на новой площадке плагин ставят вручную. Установка плагина модель не создаёт, её добавляют, как описано выше.
  • Если такой модели на площадке нет, поле модели в шаге «Речь в текст» останется пустым — модель распознавания выбирают из списка вручную.
  • Базы знаний и секреты не нужны.

Ограничения

  • Видео MP4 шаг не принимает, но и не падает: в ответе приходит строка «not a valid audio file».
  • По замеру 23.09.2026: запись с сильным шумом — 4 из 5 эталонных фактов, 15 секунд тишины — пустой текст без ошибки, запись на 15 минут — около 9 тысяч знаков.
  • Предел 50 МБ: часовая запись совещания в него не помещается, и сообщение об этом придёт от клиента, а не от приложения. У сервиса распознавания свой предел размера и длительности, он зависит от площадки.
  • Рассчитывайте на одну запись за запуск: шаг распознавания принимает одиночный файл, разбор нескольких вложений пачкой не гарантирован.
  • Кнопка микрофона в чате — другое: она надиктовывает реплику пользователя и к расшифровке файлов отношения не имеет.

Проверено

  • Это выгрузка рабочего приложения транскрибации с площадки (в выгрузке оно называется «тест аудио»), а не конфигурация, собранная генератором. Схема шага распознавания и модель сверены с ней в справочнике проекта.
  • Шаг распознавания с той же моделью замерен на тестовом наборе аудио 23.09.2026: MP3, M4A, OGG/Opus и WAV распознаются одинаково, все эталонные даты и фамилии на месте. Был ли замер сделан именно в этом приложении, источники не уточняют.
  • Записей о проверочных прогонах этого приложения с числом запусков нет.