OpenAI Whisper

OpenAI Whisper

Glas · Posodobljeno 1. 6. 2026

Odprtokodni model za prepoznavanje govora s podporo za 98 jezikov, na voljo kot brezplačno lokalno orodje in prek OpenAIjevega API za prepisovanje.

Kaj je

Whisper je splošnonamenski model za samodejno prepoznavanje govora (ASR), ki ga je razvil OpenAI. Uporablja arhitekturo transformer z enkoderjem in dekoderjem (sequence to sequence), sprva pa so ga naučili na 680.000 urah večjezičnih in večopravilnih nadzorovanih podatkov, zbranih s spleta. Model je povsem odprtokoden pod licenco MIT in je na GitHubu zbral več kot 101.000 zvezdic, s čimer se uvršča med najbolj priljubljene odprtokodne projekte AI na svetu. Whisper omogoča večjezično prepisovanje, prevajanje v angleščino, prepoznavanje jezika in zaznavanje govorne dejavnosti v 98 jezikih. Velikosti modela segajo od tiny (39 milijonov parametrov) do large (1,55 milijarde parametrov), na voljo pa je tudi različica turbo (809 milijonov parametrov, obrezana različica large-v3), ki ponuja hitro sklepanje z zanemarljivo izgubo kakovosti. Najnovejša odprtokodna izdaja je v20250625. Prek svojega API pa OpenAI ponuja whisper-1 po 0,006 USD na minuto ter novejše modele gpt-4o-transcribe z izboljšano natančnostjo in podporo za pretakanje. Okoli Whisperja je nastal obsežen ekosistem skupnosti, med drugim whisper.cpp (predelava v C/C++ za sklepanje na procesorju), faster-whisper (na osnovi CTranslate2, 4-krat hitrejši) in insanely-fast-whisper (paketno sklepanje na grafični kartici). Že sam model large-v3-turbo ima na HuggingFaceu več kot 3,38 milijona prenosov na mesec.

Za koga

01

Razvijalce, ki v aplikacije vgrajujejo funkcije pretvorbe govora v besedilo in želijo preverjen, zanesljiv mehanizem za prepisovanje

02

Podjetja, ki želijo prepisovanje na lastni infrastrukturi, ne da bi občutljive zvočne podatke pošiljala v oblak

03

Raziskovalce, ki potrebujejo odprt model, ki ga lahko dodatno učijo, spreminjajo in preučujejo za specializirana področja

04

Ustvarjalce vsebin, ki v velikem obsegu prepisujejo podkaste, videoposnetke, intervjuje in posnetke

05

Večjezične organizacije, ki potrebujejo prepisovanje v številnih jezikih z enim samim modelom

06

Zagonska podjetja, ki želijo začeti z brezplačnim odprtokodnim modelom in po želji pozneje preiti na API

Prednosti in slabosti

Prednosti

  • +Povsem odprta koda pod licenco MIT brez omejitev uporabe omogoča neomejeno komercialno in osebno uporabo brez stroškov
  • +Brezplačno lokalno poganjanje na lastni strojni opremi, od Raspberry Pi (model tiny) do grafične kartice v delovni postaji (model large)
  • +Podpora za 98 jezikov s samodejnim zaznavanjem jezika, eden jezikovno najbogatejših razpoložljivih modelov ASR
  • +Več velikosti modela omogoča pravo razmerje med hitrostjo in natančnostjo glede na vašo strojno opremo in primer uporabe
  • +Obsežen ekosistem skupnosti, med drugim whisper.cpp, faster-whisper in insanely-fast-whisper z občutnimi izboljšavami zmogljivosti
  • +Možnost API ponuja upravljano izkušnjo brez zapletov za ekipe, ki ne želijo upravljati infrastrukture z grafičnimi karticami
  • +Časovne oznake na ravni besed omogočajo natančno ustvarjanje podnapisov, urejanje zvoka in sinhronizirane besedilne prekrivke

Slabosti

  • Model large-v3 potrebuje približno 10 GB pomnilnika VRAM, zato je nedosegljiv za računalnike brez namenske grafične kartice
  • Model turbo ne zna prevajati (le prepisovati), zato je za prevajanje še vedno potreben polni model large ali starejši modeli
  • Cena API se pri velikih obremenitvah sešteje; pri 0,006 USD na minuto 1.000 ur zvoka stane 360 USD
  • Novejši modeli gpt-4o-transcribe niso odprtokodni, zato je najboljša natančnost prek API dostopna le v plačljivi storitvi
  • Natančnost se med jeziki občutno razlikuje; jeziki z veliko viri (angleščina, španščina, francoščina) se odrežejo precej bolje kot jeziki z malo viri
  • 30-sekundno obdelovalno okno lahko povzroča težave pri dolgih premorih, tišini ali negovornih odsekih zvoka

Cenik

Odprta koda0 USD
  • Vse velikosti modela (od tiny do large-v3)
  • Vključena različica turbo
  • Podpora za 98 jezikov
API (whisper-1)po dogovoru
  • 0,006 USD na minuto zvoka
  • Upravljana infrastruktura
  • Samodejno zaznavanje jezika
Najbolj izbranAPI (gpt-4o-mini-transcribe)po dogovoru
  • 0,003 USD na minuto zvoka
  • Izboljšana natančnost v primerjavi z whisper-1
  • Podpora za pretakanje
  • Upravljana infrastruktura
API (gpt-4o-transcribe)po dogovoru
  • 0,006 USD na minuto zvoka
  • Najvišja natančnost
  • Popolna podpora za pretakanje

Cene se spreminjajo; preverite uradni cenik →

OpenAI Whisper: odprtokodno prepoznavanje govora za 98 jezikov | NativeAI