Ik bouw een voice ai agent met elevenlabs, stt en llm in python


Over deze dienst
Automatische vertaling
Implementeer een intelligente Voice AI agent die kan luisteren, redeneren en spreken in realtime.
Ik ontwikkel aangepaste conversational Voice AI-architecturen in Python, waarbij lage-latentie audio streaming wordt gecombineerd met LLMs en spraaksynthese.
Wat ik lever:
- End-to-end Voice Pipelines: Voice Activity Detection (VAD) + Whisper (STT) + LLM Redenering + ElevenLabs (TTS)
- Ultra-lage Latentie Audio Routing via asynchrone Linux pipes
- Integratie van Telegram Voice Calls via Pyrogram
- Cloud GPU Deployment (RunPod container workers, parallel queue processing, dynamische schaalvergroting)
- Modulaire Python backend met geïsoleerde audio-opname en synthese
Stack: Python, asyncio, ElevenLabs, Whisper, RunPod GPU, Pyrogram.
Neem contact met mij op voordat je bestelt om API-gegevens en voice latency vereisten te bespreken.
Maak kennis met Moddie
Fullstack web developer
- Afkomstig uitOekraïne
- Lid sindsokt 2024
- Gem. reactietijd1 uur
Talen
Oekraïens, Russisch, Engels
Automatische vertaling
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Hoe bereik je lage latency bij spraaksynthese?
Ik stream audio chunks via asynchrone Linux pipes direct naar de speler zonder tijdelijke audio bestanden op te slaan, waardoor de latency onder de 600ms blijft
Kan deze voice agent telefoongesprekken of Telegram-gesprekken maken?
Ja, ik kan de agent integreren met Telegram voice calls via Pyrogram of externe telephony APIs (Twilio/LiveKit)

