В этом году в Ubuntu появятся функции на базе искусственного интеллекта. Основатель дистрибутива Марк Шаттлворт рассчитывает, что Ubuntu станет операционной системой для «эпохи агентов». Большие амбиции начинаются с малого, и первый шаг — это инструмент для преобразования речи в текст под названием Myna.

Название — Myna. Инструмент дебютирует в октябре в составе Ubuntu 26.10. У него не будет визуального интерфейса: для активации потребуется нажать сочетание клавиш.

Это легковесное приложение для голосового ввода на основе ИИ. Пользователь нажимает горячую клавишу и начинает говорить, а слова сами появляются на экране. Вице-президент по разработке Canonical Джон Сиджер пояснил, что надиктовать текст можно в любое поле, доступное для ввода с клавиатуры.

Свою позицию Сиджер озвучил на Ubuntu Summit: «Зачем печатать агенту, словно животное, когда можно просто поговорить с ним?».

Впрочем, совсем без клавиатуры обойтись не получится — понадобится стирать то, что модель распознавания речи решила напечатать, пока вы диктовали письмо с набитым ртом. При этом разработчики не планируют разрешать голосовой ввод в поля для паролей.

Речь идёт не о чат-боте, встроенном в панель GNOME, и не о навязчивом Copilot, роющемся в правах суперпользователя. Новинка представляет собой голосовую диктовку на базе моделей распознавания речи. Качественная диктовка в Linux была востребована десятилетиями, и теперь Canonical готова её реализовать.

Голос пользователя никуда не передаётся. Ubuntu задействует локальную открытую модель, работающую непосредственно на устройстве. Никаких облачных ИИ-сервисов. Микрофон активируется только при нажатии горячей клавиши, а аудиопоток обрабатывается в памяти и сразу уничтожается. По крайней мере, так это задумано.

Пока GitHub проекта Myna содержит лишь цели и архитектурные диаграммы. Описан следующий процесс: песочница Inference Snap обрабатывает аудио, а Myna выступает оркестратором речи, управляя тем, где и когда это происходит.

Протестировать инструмент пока нельзя, хотя времени остаётся немного. Canonical собирает обратную связь от пользователей, уже знакомых с инструментами диктовки на других платформах, чтобы точнее настроить специфику работы.

Кто-то может счесть функцию нишевой. Никто не станет развлекаться, надиктовывая команды оболочки в терминал (энтузиазм от этого иссякает ровно через 4 минуты 10 секунд). Однако для длинных текстов голосовой ввод ценен тем, кто любит звук собственного голоса и говорит быстрее, чем печатает.

Иллюзорные сценарии гиперпродуктивности в духе венчурных инвесторов, сочиняющих питч-деки на бегу, не главное. Основной выигрыш — в доступности. Инструменты преобразования текста в речь в Ubuntu не славятся качеством. Если бум ИИ приведёт к их улучшению, это хорошая новость.

Языковая поддержка будет зависеть от модели, которую подключат к Myna. Canonical изучает Whisper, Nemotron от Nvidia, Parakeet и Qwen3-ASR, и некоторые из них предлагают мультиязычные варианты.

Ассистент не предусмотрен по замыслу. Голосовые команды, управление рабочим столом, фразы пробуждения и непрерывное прослушивание в задачи Myna не входят. Canonical намерена сначала сосредоточиться на базовых вещах.

Название Myna отсылает к птице-майне, известной умением точно имитировать человеческую речь. Правда, приложение не имитирует пользователя, а просто помещает слова в нужное текстовое поле, что не вполне отражает суть имени. В английском языке эта игра слов позволяет назвать это «myna quibble» — незначительной придиркой.

Отказаться от ИИ-функций будет легко. Они используют слишком крупные модели для включения в установщик ОС, поэтому распространяются в виде Snap-пакетов, которые можно удалить. Усталость от ИИ и потока сгенерированного контента — реальное явление, и возможно, кому-то принесёт облегчение команда sudo snap remove all-the-ai.

Словом, наконец-то в Linux появляется достойная диктовка.