ElevenLabs sait monter un agent vocal qui décroche le téléphone, répond, déclenche des actions et transfère à un humain quand il bloque. La configuration tient dans une demi-journée. Les réglages qui rendent l'agent utilisable demandent ensuite quelques jours d'appels réels et de transcriptions relues.
Ce tutoriel déroule les six étapes, de la page blanche au numéro qui sonne. Deux précisions avant de commencer. L'éditeur ne vend aucun numéro de téléphone, il faut en apporter un. Et le prix affiché ne couvre qu'un des trois compteurs qui tournent pendant un appel.
ElevenAgents, ce que la plateforme fait vraiment
ElevenAgents est le nom du produit d'agents conversationnels d'ElevenLabs, relevé sur la page de l'éditeur en octobre 2026. La plateforme couvre la voix, le chat écrit et l'e-mail, dans plus de 90 langues. Un agent vocal y repose sur quatre briques assemblées par l'éditeur.
- Transcription. Le modèle maison Scribe écoute l'appelant et écrit ce qu'il dit.
- Modèle de langage. Vous choisissez le modèle qui raisonne, de la famille GPT à Claude Opus 5.5, ou vous branchez le vôtre.
- Synthèse vocale. Eleven v4 Turbo est arrivé en septembre 2026, annoncé autour de 100 millisecondes de latence.
- Tour de parole. Un modèle propriétaire décide quand l'agent parle et quand il laisse parler.

Cette architecture enchaîne trois technologies distinctes avant de produire un son. Un modèle audio direct fonctionne autrement, et j'ai détaillé la différence entre les deux approches dans l'article sur le pipeline vocal et le voice-to-voice. Le choix a une conséquence directe sur la latence ressentie et sur la facture.
Étape 1, créer l'agent et annoncer qu'il est une IA
Dans le tableau de bord, créez un agent à partir du modèle vierge. Vous renseignez un nom, une langue, puis le premier message. Ce premier message est la phrase que l'agent prononce avant toute autre chose, et c'est là que se joue votre conformité au règlement européen sur l'intelligence artificielle.

Étape 2, écrire un prompt système qui tient la route
Le prompt système est le document qui porte tout le comportement de l'agent. Un prompt écrit à la va-vite produit un agent bavard, qui improvise et qui perd l'appelant. La structure que j'utilise depuis mes premiers déploiements tient en six blocs.
- Le rôle. Une phrase qui donne une identité et un ton, du type « vous êtes la standardiste de telle société ».
- La mission. Ce que l'agent doit obtenir, qualifier une demande, poser un rendez-vous, orienter vers le bon service.
- Les étapes. L'ordre dans lequel il récolte les informations, saluer, demander le prénom, puis l'adresse.
- Le contexte métier. Les horaires, les délais d'intervention, les produits, les tarifs publics.
- Des exemples de dialogue. Deux ou trois échanges réalistes orientent le style mieux qu'une consigne abstraite.
- Une section de règles. Les contraintes dures, phrases courtes, pas d'énumération, reformuler si l'appelant est vague.
La consigne la plus rentable concerne la longueur des réponses. Imposez une à deux phrases maximum. À l'oral, un paragraphe de quatre lignes passe pour un monologue et l'appelant coupe la parole. J'avais détaillé cette grille de prompt dans mon édition sur ce que l'on peut vraiment automatiser avec un agent vocal, et elle n'a pas bougé depuis.
Étape 3, charger la base de connaissance
La section base de connaissance accepte des documents et des pages publiques. Une fois la recherche activée, l'agent va chercher le passage utile au lieu de porter tout le catalogue dans son prompt. C'est le bon endroit pour les questions fréquentes, les conditions générales et les fiches produit.
Gardez le prompt système pour le comportement et la base de connaissance pour les faits. Un prompt qui enfle à mille lignes devient impossible à maintenir, et l'agent commence à mélanger les procédures. La séparation des deux est ce qui fait tenir un agent dans la durée.
Étape 4, donner des outils à l'agent
Un agent sans outil ne fait que parler. La plateforme fournit huit outils système prêts à l'emploi, qui couvrent l'essentiel des besoins d'un standard téléphonique.
- Raccrocher, quand la conversation est terminée.
- Détecter la langue, pour basculer sur celle de l'appelant.
- Transférer vers un autre agent, spécialisé sur un sujet précis.
- Transférer vers un numéro, donc vers un humain.
- Passer son tour, pour attendre sans parler.
- Jouer une tonalité de clavier, pour naviguer dans un serveur vocal tiers.
- Détecter un répondeur, et laisser un message différent le cas échéant.
- Mettre à jour une variable, sans appeler aucune interface externe.
Au-delà, vous branchez vos propres actions. Un outil appelle une interface externe pour envoyer un SMS, lire un agenda ou écrire dans le gestionnaire de relation client. Depuis septembre 2026, l'agent peut déclencher plusieurs outils dans le même tour de parole, un réglage désormais actif par défaut.
Étape 5, brancher un numéro de téléphone
C'est l'étape que tout le monde sous-estime. ElevenLabs ne vend pas de numéro. Deux chemins existent, et le bon dépend de votre volume.
- Importer un numéro Twilio. Vous collez un identifiant et un jeton d'authentification dans l'onglet des numéros, puis vous désignez l'agent qui prend les appels. Un numéro acheté gère l'entrant et le sortant. Un identifiant d'appelant vérifié ne sert qu'au sortant.
- Raccorder votre opérateur. Le raccordement en protocole SIP branche votre infrastructure téléphonique existante. L'éditeur expose des serveurs à adresses fixes, avec des points d'entrée isolés par région, dont l'Europe.
Comptez un délai pour obtenir un numéro géographique français. L'opérateur demande un justificatif d'immatriculation de la société, et la validation prend quelques jours. Anticipez cette démarche avant de promettre une date de mise en service.

Étape 6, les appels sortants, et la règle française qui a changé
La plateforme sait lancer des campagnes d'appels groupés, avec une limite de simultanéité que vous fixez. La détection de répondeur évite de brûler des minutes dans le vide. Techniquement, rien ne vous empêche de déclencher des milliers d'appels depuis un tableur.
La règle vise les consommateurs, pas les appels entrants ni la relation client existante. Les détails officiels sont publiés par les services de l'État. Les cas d'usage qui restent solides sont le standard téléphonique, la prise de rendez-vous, le rappel d'un prospect qui vient de remplir un formulaire, et la relance d'un client sur un dossier en cours.
Combien coûte un agent vocal ElevenLabs ?
La minute d'agent coûte environ 7 centimes au-delà du forfait, et ce tarif est identique du palier gratuit au palier Business. Le palier que vous choisissez achète donc surtout de la simultanéité, c'est-à-dire le nombre d'appels que l'agent peut tenir en même temps.
| Palier | Prix mensuel | Minutes comprises | Appels simultanés |
|---|---|---|---|
| Gratuit | 0 € | 15 | 4 |
| Starter | environ 5 € | 75 | 6 |
| Creator | environ 20 € | 275 | 10 |
| Pro | environ 90 € | 1 238 | 20 |
| Scale | environ 275 € | 3 738 | 30 |
| Business | environ 910 € | 12 375 | 40 |
Deux pièges se cachent derrière ce tableau. Le dépassement de simultanéité se facture au double de la minute normale, ce qui coûte cher sur un pic d'appels mal anticipé. Et les jetons du modèle de langage se paient en plus, déduits de vos crédits, comme l'indique la page de tarifs. La ligne téléphonique forme le troisième compteur.

Ce qui bloque sur un déploiement français
La question de l'hébergement des données se pose avant la première minute d'appel. ElevenLabs propose un environnement isolé en Europe, mais sa documentation le réserve aux contrats Enterprise. Les paliers accessibles en libre service n'y donnent pas accès, et c'est le point qui fait échouer la plupart des projets dans un secteur régulé.
Deux limites méritent d'être lues avant de signer. Même dans l'environnement isolé, un modèle de langage personnalisé ou un webhook de fin d'appel peut entraîner un traitement hors région. Et le mode sans rétention, qui empêche la conservation des contenus sur les serveurs de l'éditeur, s'active séparément. Posez ces deux questions à votre interlocuteur commercial, par écrit.
Un enregistrement d'appel contient une voix, donc une donnée personnelle. Tandem traite systématiquement ce point dans le cadrage, avant la première ligne de prompt. Si le sujet vous concerne, notre offre autopilote couvre ce cadrage en même temps que le montage technique.
Faut-il construire cet agent ou acheter une solution verticalisée ?
C'est la vraie question avant de se lancer. Je l'ai posée publiquement dans une publication sur l'arbitrage entre construire et acheter en juillet 2026, et la réponse n'est pas universelle. Une solution prête à l'emploi se déploie en quelques jours, avec des coûts prévisibles et des mises à jour continues. Un développement interne demande des mois et une équipe dédiée.

Monter son agent sur ElevenLabs tient le milieu entre les deux. Vous gardez la main sur le prompt, les outils et la voix, sans écrire d'infrastructure téléphonique. Si vous hésitez encore sur la plateforme, le comparatif des plateformes d'agents vocaux traite ce choix en détail, et le guide des agents vocaux traite la méthode de déploiement.
Un dernier arbitrage mérite d'être posé tôt. Beaucoup de demandes qui arrivent en « agent vocal » se traitent mieux à l'écrit, et pour bien moins cher. J'ai raconté un cas de ce genre dans l'article sur l'agent WhatsApp d'un artisan. Le téléphone garde sa valeur quand l'appelant décroche déjà, et que personne ne répond.
Faut-il créer son agent vocal avec ElevenLabs ?
Oui, pour un standard téléphonique, une prise de rendez-vous ou une qualification simple, à condition d'accepter trois choses. La voix est la meilleure du marché et c'est ce qui se paie, comme je l'écrivais dans le comparatif des générateurs audio. La ligne téléphonique reste à votre charge. Et l'hébergement européen se négocie en contrat Enterprise.
Non, si votre dossier impose une donnée qui ne sort pas d'Europe sans budget Enterprise, ou si votre besoin est une campagne sortante vers des particuliers. Dans ce second cas, la règle française a tranché avant vous. Pour le reste, ce que j'écrivais sur la bascule de qualité des agents vocaux reste vrai, et la technologie n'est plus le facteur limitant.



