Открытый инструмент голосового ввода для Linux Vocalinux представил бета-версию 0.14, в которой заметно доработали горячие клавиши, удалённую транскрипцию и стабильность работы в Wayland.

Начнём с самого заметного улучшения. Раньше пользователям приходилось довольствоваться стандартным переключением или режимом рации для записи аудио. Теперь в меню Settings можно назначить собственные горячие клавиши и собирать любые комбинации с Ctrl, Alt, Shift, Super и буквенными или цифровыми клавишами.

Кроме того, в сеансе Wayland на GNOME снова работает вставка текста, если сконфигурирован чистый движок XKB, а whisper.cpp больше не пытается по умолчанию занять все ядра процессора на гибридных ноутбуках Intel и AMD.

Пользователи Remote API тоже не остались в стороне: движок Remote API теперь поддерживает модели FunASR и SenseVoice через совместимые с OpenAI endpoint’ы.

Что такое Vocalinux?

Диалог «О программе» и меню настроек Vocalinux
Диалог «О программе» и меню настроек Vocalinux
Диалог «О программе» и меню настроек Vocalinux
Диалог «О программе» и меню настроек Vocalinux

Мы вкратце упомянули новый выпуск, но не объяснили, что представляет собой Vocalinux. Это бесплатное приложение для голосового ввода под Linux с открытым исходным кодом, распространяемое под лицензией GPL-3.0. Оно размещается в системном лотке и позволяет диктовать текст практически в любое текстовое поле: в терминалы, браузеры, IDE, офисные приложения — туда, где находится курсор.

Вся обработка происходит локально, поэтому голосовые данные не покидают ваш компьютер.

Выбор движка распознавания тоже не навязан: по умолчанию используется whisper.cpp, дополнительно доступны Whisper для конфигураций с PyTorch и NVIDIA, VOSK для легковесных систем и Remote API для выноса нагрузки на удалённый сервер.

Мы протестировали эту бета-версию на двух дистрибутивах — Fedora Workstation и Ubuntu. В обоих случаях приложение не запускалось ни через лаунчер, ни из терминала. На Ubuntu оно в конце концов стартовало после выполнения некоторых шагов по устранению неполадок, но оказалось неотзывчивым и его пришлось завершить. Впрочем, такое поведение свойственно предварительным сборкам, и расстраиваться тут не стоит.

Как начать работу

Быстро познакомиться с инструментом можно через демо на сайте Vocalinux, которое запускает SpeechRecognition прямо в браузере — разумеется, только для ознакомления.

Установщик Vocalinux в терминале Ubuntu
Установщик Vocalinux в терминале Ubuntu

Если вы хотите запустить распознавание речи локально на своей Linux-машине, установите Vocalinux с помощью скрипта:

⚠️ Всегда проверяйте подобные скрипты перед запуском.

curl -fsSL https://raw.githubusercontent.com/jatinkrmalik/vocalinux/main/install.sh -o /tmp/vl.sh && bash /tmp/vl.sh --interactive

После завершения установки выполните vocalinux или найдите значок приложения в лаунчере. Если затрудняетесь с выбором движка, загляните в сравнительную таблицу — она поможет определиться.

Исходный код Vocalinux размещён на GitHub.

Обратите внимание: на дистрибутивах, не основанных на Debian (например, Fedora), установщик выдаст предупреждение о необходимости вручную доустановить зависимости — учитывайте это до начала работы.

Редакция благодарит Phoronix за наводку. 😄