Шаблонv1.0.0бетаготовое приложение
Транскрибация аудио
Чат-приложение переводит аудиозапись в текст встроенным распознаванием речи платформы с моделью whisper-large-v3, без отдельного плагина и ключа стороннего сервиса. MP3, M4A, OGG и WAV; расшифровка выдаётся одной строкой без разбивки по говорящим.
Схема логики
Как это работает
- Сотрудник: Отправляет аудио — запись или файл
- Документы: Распознаёт речь — аудио в текст
- Сотрудник: Получает текст — расшифровка записи
Транскрибация аудио
Чат-приложение переводит аудиозапись в текст: пользователь прикладывает файл, в ответ получает расшифровку. Распознавание делает встроенный в ядро платформы провайдер речи — отдельный плагин и ключ стороннего сервиса не нужны, модель распознавания берётся из настроек площадки. Решение пригодится делопроизводству для записей совещаний, продажам для разговоров с клиентами и кадрам для собеседований.
Что на входе
- Аудиофайл, приложенный к сообщению в чате. Проверены MP3, M4A, OGG/Opus и WAV.
- Формы запуска нет.
- Настройки загрузки: до трёх файлов на сообщение, предел аудиофайла — 50 МБ. Распознавание рассчитано на одну запись за раз (см. «Ограничения»).
Что на выходе
- Ответ в чате: расшифровка одной сплошной строкой — без разметки, без разбивки по говорящим и без отметок времени.
Как работает
- Пользователь прикладывает запись к сообщению.
- Встроенный провайдер речи передаёт файл модели распознавания whisper-large-v3.
- Расшифровка выводится в ответ как есть, без обработки языковой моделью.
- Если нужен протокол, выжимка, список задач или разделение реплик, за распознаванием ставят отдельный шаг с языковой моделью — в этом решении его нет.
Что настроить после установки
- Модель распознавания: Настройки → Поставщик моделей →
OpenAI-API-compatible — добавить модель
openai/whisper-large-v3с типом «речь в текст», адресом и ключом того сервиса, где она развёрнута. - Плагин провайдера
langgenius/openai_api_compatible. Это выгрузка с площадки, где он уже стоял, поэтому в списке зависимостей его нет — на новой площадке плагин ставят вручную. Установка плагина модель не создаёт, её добавляют, как описано выше. - Если такой модели на площадке нет, поле модели в шаге «Речь в текст» останется пустым — модель распознавания выбирают из списка вручную.
- Базы знаний и секреты не нужны.
Ограничения
- Видео MP4 шаг не принимает, но и не падает: в ответе приходит строка «not a valid audio file».
- По замеру 23.09.2026: запись с сильным шумом — 4 из 5 эталонных фактов, 15 секунд тишины — пустой текст без ошибки, запись на 15 минут — около 9 тысяч знаков.
- Предел 50 МБ: часовая запись совещания в него не помещается, и сообщение об этом придёт от клиента, а не от приложения. У сервиса распознавания свой предел размера и длительности, он зависит от площадки.
- Рассчитывайте на одну запись за запуск: шаг распознавания принимает одиночный файл, разбор нескольких вложений пачкой не гарантирован.
- Кнопка микрофона в чате — другое: она надиктовывает реплику пользователя и к расшифровке файлов отношения не имеет.
Проверено
- Это выгрузка рабочего приложения транскрибации с площадки (в выгрузке оно называется «тест аудио»), а не конфигурация, собранная генератором. Схема шага распознавания и модель сверены с ней в справочнике проекта.
- Шаг распознавания с той же моделью замерен на тестовом наборе аудио 23.09.2026: MP3, M4A, OGG/Opus и WAV распознаются одинаково, все эталонные даты и фамилии на месте. Был ли замер сделан именно в этом приложении, источники не уточняют.
- Записей о проверочных прогонах этого приложения с числом запусков нет.