Język polski: rozpoznawanie na samym telefonie
Polski to jeden z 99 języków, które Kaseta zamienia na tekst. Ważne jest nie to, że jest na liście, tylko gdzie wykonywana jest praca: modele rozpoznawania pobierasz raz, a działają na sprzęcie samego iPhone’a. Aplikacja nigdzie nagrania nie wysyła – za rozpoznawaniem nie stoi żaden serwer.
Co to znaczy w praktyce
Dyktafon nagrywa, a po dotknięciu Stop telefon robi transkrypcję – w trakcie mówienia tekstu nie ma. Sieć może być przy tym wyłączona całkowicie, gdy modele są już pobrane: w samolocie, w metrze, w budynku bez zasięgu. Konta nie ma – nie ma gdzie się rejestrować, bo nie ma serwera, który miałby Cię pamiętać. I nic nie ustawia się w kolejce do cichego wysłania później, kiedy wróci Wi-Fi.
To właściwość, którą warto sprawdzić samemu w minutę: tryb samolotowy, nagranie, Stop, tekst. Poradnik o transkrypcji offline rozkłada to sprawdzenie na kroki.

Język rozpoznawania i język aplikacji to dwie różne rzeczy
To miejsce, w którym łatwo wprowadzić czytelnika w błąd, więc powiedzmy wprost. Silnik rozpoznaje 99 języków. Interfejs samej aplikacji – przyciski, menu, ustawienia – wychodzi w 39 lokalizacjach App Store, a to 33 języki, jeśli warianty regionalne liczyć raz, i tak czy inaczej krótsza lista. Jedna liczba to nie druga. Polska transkrypcja nie zależy od tego, w jakim języku opisane są przyciski: język transkrypcji ustawiasz raz, w Ustawieniach, niezależnie od języka interfejsu.
Gdzie są granice
- Nie mierzyliśmy dokładności. Ani dla polskiego, ani dla pozostałych języków – dlatego nie będzie tu liczby. Zamiast procentu, którego nikt nie policzył, jest sprawdzenie: nagraj minutę tak, jak nagrywasz zwykle, i zobacz wynik.
- Trudne audio pozostaje trudne. Kilka głosów naraz, głośny pokój, telefon w kieszeni – to psuje rozpoznawanie każdemu systemowi, chmurowemu też.
- Rozdzielanie mówców jest na życzenie – to przycisk na gotowej transkrypcji – ale w darmowym planie tylko w tych pierwszych 5 minutach. Też liczone na samym telefonie; dalej nie ma tekstu, więc nie ma i rozdzielania.
- Przełączanie języków w środku zdania wychodzi gorzej niż czysta polszczyzna: język to jedno ustawienie, a nie wybór na każde zdanie.
- Plan darmowy transkrybuje pierwsze 5 minut każdego nagrania. Samo nagrywanie się nie urywa – dźwięk nagrywa się dalej i zapisuje w całości. Liczba nagrań jest nieograniczona.
- Eksport – zwykły tekst, Markdown, SRT, WebVTT lub JSON – działa w każdym planie, tak jak kopiowanie.
Ile to kosztuje
Pro kosztuje 19,99 USD rocznie albo 39,99 USD raz na zawsze. Abonamentu za minuty nie ma i nie będzie: minuty liczy się tam, gdzie płaci się za nie serwerom, a tutaj nie ma czego liczyć.
Dalej: wszystkie języki, które rozpoznaje Kaseta albo krótka wersja na stronie głównej.