Українська мова: розпізнавання просто на телефоні
Українська – одна з 99 мов, які Kaseta переводить у текст. Важливо не те, що вона є у списку, а те, де відбувається робота: моделі розпізнавання завантажуються один раз і далі виконуються процесором самого iPhone. Запис нікуди не вивантажується – розпізнавання не має сервера, якому його можна було б віддати.
Що це означає на практиці
Диктофон записує; ви натискаєте «Стоп», і телефон готує текст – під час запису тексту немає, він з’являється після зупинки. Мережа при цьому може бути вимкнена повністю: у літаку, у метро, у селі без покриття. Акаунта немає – реєструватися нема де, бо немає сервера, який би вас пам’ятав. І нічого не стає в чергу на «тиху» відправку пізніше, коли Wi-Fi повернеться.
Це та властивість, яку варто перевірити самому за хвилину: авіарежим, запис, «Стоп», текст. Гайд про офлайн-розшифровку розкладає цю перевірку по кроках.

Мова розпізнавання і мова застосунку – різні речі
Це місце, де легко ввести читача в оману, тому скажемо прямо. Рушій розпізнає 99 мов. Інтерфейс самого застосунку – кнопки, меню, налаштування – виходить у 39 локалізаціях App Store, а це 33 мови, якщо рахувати регіональні варіанти один раз. Українська серед них:
Інтерфейс самого застосунку
- English
- Español
- Português
- Français
- Deutsch
- Italiano
- Nederlands
- Polski
- Русский
- Українська
- Türkçe
- العربية
- עברית
- 中文(简体)
- 中文(繁體)
- 日本語
- 한국어
- हिन्दी
- Bahasa Indonesia
- Bahasa Melayu
- ไทย
- Tiếng Việt
- Svenska
- Dansk
- Norsk
- Suomi
- Čeština
- Slovenčina
- Magyar
- Română
- Ελληνικά
- Hrvatski
- Català
Це коротший список, ніж у рушія, і жодне з цих чисел не дорівнює іншому. Українська транскрибація не залежить від того, якою мовою підписані кнопки: мову розпізнавання ви обираєте один раз у налаштуваннях (або залишаєте автовизначення), а не в мові інтерфейсу.
Де межі
- Точність ми не міряли. Ні для української, ні для інших мов – тому цифри тут не буде. Замість відсотка, якого ніхто не рахував, ось перевірка: запишіть хвилину так, як записуєте зазвичай, і подивіться на результат.
- Складне аудіо залишається складним. Кілька голосів одночасно, гучна кімната, телефон у кишені – усе це псує розпізнавання будь-якій системі, і хмарній теж.
- Розділення спікерів – за кнопкою на готовій розшифровці, зі своїми моделями і обмеженням у 60 хвилин обробки на будь-якому тарифі. На безкоштовному тарифі мітки покривають перші 5 хвилин; далі розшифровки немає взагалі, отже, немає і розділення.
- Суржик і перемикання мов усередині одного речення розпізнаються гірше, ніж чиста українська: мова задається одна на прохід розпізнавання, а не на кожну фразу.
- Безкоштовний тариф розшифровує перші 5 хвилин кожного запису. Сам запис при цьому не обривається – аудіо пишеться далі й зберігається повністю. Кількість записів не обмежена; Pro розшифровує запис цілком.
- Експорт файлами – Plain Text, Markdown, SRT, WebVTT і JSON – доступний на будь-якому тарифі, як і копіювання тексту.
Скільки це коштує
Pro коштує $19.99 на рік або $39.99 один раз назавжди. Підписки за хвилини немає й не буде: хвилини рахують там, де за них платять серверам, а тут рахувати нема чого.
Далі: усі мови, які Kaseta розпізнає, або коротка версія на головній.