OpenAI Whisper
Odprtokodni model za prepoznavanje govora s podporo za 98 jezikov, na voljo kot brezplačno lokalno orodje in prek OpenAIjevega API za prepisovanje.
Kaj je
Whisper je splošnonamenski model za samodejno prepoznavanje govora (ASR), ki ga je razvil OpenAI. Uporablja arhitekturo transformer z enkoderjem in dekoderjem (sequence to sequence), sprva pa so ga naučili na 680.000 urah večjezičnih in večopravilnih nadzorovanih podatkov, zbranih s spleta. Model je povsem odprtokoden pod licenco MIT in je na GitHubu zbral več kot 101.000 zvezdic, s čimer se uvršča med najbolj priljubljene odprtokodne projekte AI na svetu. Whisper omogoča večjezično prepisovanje, prevajanje v angleščino, prepoznavanje jezika in zaznavanje govorne dejavnosti v 98 jezikih. Velikosti modela segajo od tiny (39 milijonov parametrov) do large (1,55 milijarde parametrov), na voljo pa je tudi različica turbo (809 milijonov parametrov, obrezana različica large-v3), ki ponuja hitro sklepanje z zanemarljivo izgubo kakovosti. Najnovejša odprtokodna izdaja je v20250625. Prek svojega API pa OpenAI ponuja whisper-1 po 0,006 USD na minuto ter novejše modele gpt-4o-transcribe z izboljšano natančnostjo in podporo za pretakanje. Okoli Whisperja je nastal obsežen ekosistem skupnosti, med drugim whisper.cpp (predelava v C/C++ za sklepanje na procesorju), faster-whisper (na osnovi CTranslate2, 4-krat hitrejši) in insanely-fast-whisper (paketno sklepanje na grafični kartici). Že sam model large-v3-turbo ima na HuggingFaceu več kot 3,38 milijona prenosov na mesec.
Za koga
Razvijalce, ki v aplikacije vgrajujejo funkcije pretvorbe govora v besedilo in želijo preverjen, zanesljiv mehanizem za prepisovanje
Podjetja, ki želijo prepisovanje na lastni infrastrukturi, ne da bi občutljive zvočne podatke pošiljala v oblak
Raziskovalce, ki potrebujejo odprt model, ki ga lahko dodatno učijo, spreminjajo in preučujejo za specializirana področja
Ustvarjalce vsebin, ki v velikem obsegu prepisujejo podkaste, videoposnetke, intervjuje in posnetke
Večjezične organizacije, ki potrebujejo prepisovanje v številnih jezikih z enim samim modelom
Zagonska podjetja, ki želijo začeti z brezplačnim odprtokodnim modelom in po želji pozneje preiti na API
Prednosti in slabosti
Prednosti
- +Povsem odprta koda pod licenco MIT brez omejitev uporabe omogoča neomejeno komercialno in osebno uporabo brez stroškov
- +Brezplačno lokalno poganjanje na lastni strojni opremi, od Raspberry Pi (model tiny) do grafične kartice v delovni postaji (model large)
- +Podpora za 98 jezikov s samodejnim zaznavanjem jezika, eden jezikovno najbogatejših razpoložljivih modelov ASR
- +Več velikosti modela omogoča pravo razmerje med hitrostjo in natančnostjo glede na vašo strojno opremo in primer uporabe
- +Obsežen ekosistem skupnosti, med drugim whisper.cpp, faster-whisper in insanely-fast-whisper z občutnimi izboljšavami zmogljivosti
- +Možnost API ponuja upravljano izkušnjo brez zapletov za ekipe, ki ne želijo upravljati infrastrukture z grafičnimi karticami
- +Časovne oznake na ravni besed omogočajo natančno ustvarjanje podnapisov, urejanje zvoka in sinhronizirane besedilne prekrivke
Slabosti
- −Model large-v3 potrebuje približno 10 GB pomnilnika VRAM, zato je nedosegljiv za računalnike brez namenske grafične kartice
- −Model turbo ne zna prevajati (le prepisovati), zato je za prevajanje še vedno potreben polni model large ali starejši modeli
- −Cena API se pri velikih obremenitvah sešteje; pri 0,006 USD na minuto 1.000 ur zvoka stane 360 USD
- −Novejši modeli gpt-4o-transcribe niso odprtokodni, zato je najboljša natančnost prek API dostopna le v plačljivi storitvi
- −Natančnost se med jeziki občutno razlikuje; jeziki z veliko viri (angleščina, španščina, francoščina) se odrežejo precej bolje kot jeziki z malo viri
- −30-sekundno obdelovalno okno lahko povzroča težave pri dolgih premorih, tišini ali negovornih odsekih zvoka
Cenik
- Vse velikosti modela (od tiny do large-v3)
- Vključena različica turbo
- Podpora za 98 jezikov
- 0,006 USD na minuto zvoka
- Upravljana infrastruktura
- Samodejno zaznavanje jezika
- 0,003 USD na minuto zvoka
- Izboljšana natančnost v primerjavi z whisper-1
- Podpora za pretakanje
- Upravljana infrastruktura
- 0,006 USD na minuto zvoka
- Najvišja natančnost
- Popolna podpora za pretakanje
Cene se spreminjajo; preverite uradni cenik →