Gradnja pogovornih agentov AI

Vsi paketi (za produkcijo priporočamo Enterprise)2 min branja
1

Vzpostavite povezavo WebSocket

S svojim ključem API se povežite s končno točko ElevenAgents WebSocket. Nastavite glas, model in sistemski prompt agenta.

2

Pretakajte uporabnikov zvok

Pošljite zvok z uporabnikovega mikrofona v formatu PCM ali mu-law. Strežnik izvaja STT v realnem času.

3

LLM obdela prepis

Uporabnikov govor se prepiše in posreduje nastavljenemu modelu LLM. Agent ustvari kontekstualni odgovor in po potrebi pokliče zunanja orodja.

4

Prejmite pretočni zvok TTS

Odgovor agenta se sintetizira in pretaka nazaj v obliki zvočnih kosov. Celoten obhod je z modeli Flash krajši od 300 ms.

5

Obvladujte izmenjavo replik in prekinitve

Sistem samodejno upravlja, kdaj naj posluša in kdaj govori. Uporabniki lahko prekinejo, agent pa se naravno prilagodi.

Pravilo za skaliranje hkratnosti

Omejitev hkratnosti 5 podpira približno 100 hkratnih glasovnih pogovorov. Razlog je v tem, da je čas ustvarjanja TTS precej krajši od časa predvajanja zvoka; medtem ko en pogovor uporabniku predvaja zvok, je zmogljivost API na voljo za druge zahteve. Raven Scale (hkratnost 15 pri Multilingual, 30 pri Flash) lahko podpira stotine hkratnih klicev.
Gradnja pogovornih agentov AI | ElevenLabs API | NativeAI Hub