1
Vzpostavite povezavo WebSocket
S svojim ključem API se povežite s končno točko ElevenAgents WebSocket. Nastavite glas, model in sistemski prompt agenta.
2
Pretakajte uporabnikov zvok
Pošljite zvok z uporabnikovega mikrofona v formatu PCM ali mu-law. Strežnik izvaja STT v realnem času.
3
LLM obdela prepis
Uporabnikov govor se prepiše in posreduje nastavljenemu modelu LLM. Agent ustvari kontekstualni odgovor in po potrebi pokliče zunanja orodja.
4
Prejmite pretočni zvok TTS
Odgovor agenta se sintetizira in pretaka nazaj v obliki zvočnih kosov. Celoten obhod je z modeli Flash krajši od 300 ms.
5
Obvladujte izmenjavo replik in prekinitve
Sistem samodejno upravlja, kdaj naj posluša in kdaj govori. Uporabniki lahko prekinejo, agent pa se naravno prilagodi.
Pravilo za skaliranje hkratnosti
Omejitev hkratnosti 5 podpira približno 100 hkratnih glasovnih pogovorov. Razlog je v tem, da je čas ustvarjanja TTS precej krajši od časa predvajanja zvoka; medtem ko en pogovor uporabniku predvaja zvok, je zmogljivost API na voljo za druge zahteve. Raven Scale (hkratnost 15 pri Multilingual, 30 pri Flash) lahko podpira stotine hkratnih klicev.