Večmodalni vhod: besedilo, slike, zvok, video, PDF-ji

1 min branja
ModalnostOpenAI GPTGemini API
BesediloIzvornoIzvorno
SlikeIzvornoIzvorno
ZvokIzvornoIzvorno (do 11 ur)
VideoSamo izločanje sličicIzvorno (do 1 ure)
PDF-jiPrek nalaganja datotekIzvorno (do 1.000 strani)
Besedilo: Prompti, koda, strukturirani podatki, navodila
Slike: JPEG, PNG, GIF, WebP za vizualno odgovarjanje na vprašanja in OCR
Zvok: Do 11 ur MP3, WAV, FLAC za prepis in analizo
Video: Do 1 ure MP4 za analizo prizorov in izločanje vsebine
PDF-ji: Do 1.000 strani s polnim večmodalnim razumevanjem dokumentov

Cena zvoka se razlikuje od cene besedila

Pri modelih, kot je Gemini 2.5 Flash, zvočni vhod stane 1,00 USD/M tokenov v primerjavi z 0,30 USD/M za besedilo, slike in video. Temu prilagodite načrtovanje večmodalne uporabe. Pri obremenitvah z veliko zvoka se lahko splača zvok najprej prepisati v besedilo, če primer uporabe ne zahteva zvočne analize.
Večmodalni vhod: besedilo, slike, zvok, video, PDF-ji | Gemini API | NativeAI Hub