← Все статьи
Инструменты

WhisperKey: диктовка для Мака, которую я собрал под себя

Значительная часть моей работы - это текст: задачи агентам, письма, заметки, протоколы. В какой-то момент я посчитал очевидное: говорю я сильно быстрее, чем печатаю. Осталось найти инструмент, который превращает речь в текст в любом приложении - в мессенджере, в редакторе, в терминале.

Готовые варианты не подошли: встроенная диктовка macOS слаба для русского, облачные сервисы означают подписку и зависимость от сети, а большинство утилит работают только в своём окне. Мне нужна была системная вещь: зажал клавишу где угодно - наговорил - текст появился там, где стоит курсор.

Я такую вещь собрал. Называется WhisperKey, живёт в строке меню Мака, и через неё сейчас проходит заметная часть моего ввода - включая черновик этой статьи.

Что получилось

Механика push-to-talk, как в рации: зажал правый Option - по краям экрана загорается оранжевое свечение и появляется плашка "Говорите..." - говоришь - отпустил. Секунда-другая на распознавание, и текст вставляется в активное приложение, в то поле, где стоял курсор. Работает везде: Telegram, браузер, IDE, терминал.

Под капотом - whisper.cpp, открытая реализация распознавания речи от Георгия Герганова, модель large-v3-turbo. Вся обработка идёт прямо на ноутбуке: тяжёлая часть модели исполняется на Neural Engine - нейропроцессоре, который стоит в каждом Маке на Apple Silicon и у большинства пользователей просто простаивает. Интернет для работы не нужен, подписки нет.

Из приятного в быту: пунктуацию и заглавные буквы модель расставляет сама, во время диктовки видно живое превью распознанного, а после вставки утилита восстанавливает содержимое буфера обмена - то, что вы копировали до диктовки, не теряется.

Инженерная часть: где были грабли

Рассказываю не ради жалоб - эти грабли сэкономят время любому, кто соберётся делать системную утилиту под macOS.

Как это было построено

Отдельный пласт этой истории - процесс. Swift не был моим основным стеком: я бэкенд- и AI-инженер, а не macOS-разработчик. Приложение построено в паре с AI-агентом: архитектуру, ревью и приёмку держал я, значительную часть кода писал агент, а на каждые грабли из списка выше мы наступали и разбирали их вместе. Ядро при этом накрыто тестами, а сборка - от компиляции whisper.cpp до готового образа - собрана в воспроизводимые скрипты.

Десять лет назад такой проект означал бы нанять macOS-разработчика или похоронить идею. Сейчас это несколько вечеров инженерной работы. Это и есть главный сдвиг, который я вижу в 2026 году: персональный софт - инструмент, заточенный ровно под твой рабочий процесс, - перестал быть роскошью.

Ограничения, честно

Абзацы модель не расставляет - для длинных текстов нужна пост-обработка через LLM, диктую я всё же кусками. Превью во время речи не дословное - точен только финальный проход. И это Mac-only история: всё завязано на Apple Silicon.

Что забрать из этого кейса

Даже если вам не нужна диктовка, тут есть переносимая мысль. Инвентаризация собственной рутины - "что я делаю руками по многу раз в день" - работает не только для бизнеса, но и для личного рабочего процесса. Ввод текста оказался моей самой частой операцией, и инструмент под неё окупается каждый день.

А если нужна именно диктовка - смотрите в сторону whisper.cpp: связка "открытая модель плюс нейропроцессор, который уже есть в вашем ноутбуке" сегодня даёт качество распознавания русского, за которое ещё недавно просили подписку.