Claude n'a pas de modèle d'embedding : quoi utiliser pour ton RAG
Anthropic ne fait pas d'embeddings et le dit dans sa doc. Voyage AI est la recommandation officielle, mais ce n'est pas la seule option. Prix et choix.
Tu construis un RAG avec Claude, tu cherches claude-embedding-v1 dans la doc de l'API, et tu ne trouves rien. Ce n'est pas toi qui cherches mal.
La réponse courte
Anthropic ne propose pas de modèle d'embedding. Ni en 2026, ni avant. L'API Claude génère du texte, elle ne vectorise pas. Si tu veux transformer des documents en vecteurs pour faire de la recherche sémantique, il te faut un fournisseur tiers.
La recommandation officielle d'Anthropic, c'est Voyage AI. Mais ce n'est pas la seule option viable, et selon ton cas ce n'est même pas forcément la meilleure.
Ce que dit la doc officielle, mot pour mot
Inutile de spéculer, la documentation Anthropic sur les embeddings est explicite :
Anthropic does not offer its own embedding model. One embeddings provider that has a wide variety of options and capabilities encompassing all of the preceding considerations is Voyage AI.
Et juste après, une phrase que la plupart des articles qui recopient cette page oublient de citer :
The rest of this guide is for Voyage AI, but you should assess a variety of embeddings vendors to find the best fit for your specific use case.
Anthropic te dit lui-même d'aller comparer ailleurs. C'est une recommandation, pas une exclusivité.
Pourquoi Anthropic ne fait pas d'embeddings
Mon opinion : parce que ce n'est pas le même métier, et que le marché est déjà saturé de modèles très bons et très bon marché.
Un modèle génératif et un modèle d'embedding partagent des briques d'architecture mais répondent à des contraintes opposées. Le génératif optimise la qualité du raisonnement, coûte cher au token et se vend à la valeur produite. L'embedding optimise le débit et la latence, se vend autour de quelques centimes le million de tokens, et se fait commoditiser tous les six mois par un nouveau venu open source.
Anthropic vend du raisonnement à prix premium. Entrer sur un marché à 0,02 $ le million de tokens où ton concurrent principal distribue les poids en Apache 2.0, ça n'a aucun sens stratégique. Déléguer et documenter proprement, c'est le bon arbitrage.
Voyage AI, la recommandation officielle
Voyage AI fait des modèles d'embedding et des rerankers, avec des variantes spécialisées par domaine. La génération actuelle est Voyage 4, sortie le 15 janvier 2026.
| Modèle | Contexte | Dimensions | Prix / million de tokens |
|---|---|---|---|
voyage-4-large | 32 000 | 1024, 256, 512, 2048 | 0,12 $ |
voyage-4 | 32 000 | 1024, 256, 512, 2048 | 0,06 $ |
voyage-4-lite | 32 000 | 1024, 256, 512, 2048 | 0,02 $ |
voyage-4-nano | 32 000 | 1024, 256, 512, 2048 | poids ouverts, Apache 2.0 |
voyage-context-4 | 120 000 | 1024, 256, 512, 2048 | 0,12 $ |
rerank-2.5 | 32 000 | reranker | 0,05 $ |
rerank-2.5-lite | 32 000 | reranker | 0,02 $ |
Prix relevés sur la page tarifaire officielle de Voyage. Détail qui compte pour prototyper : les 200 premiers millions de tokens sont gratuits sur chaque compte, pour les modèles d'embedding comme pour les rerankers. Sur un corpus de documentation interne, ça veut dire que ta phase d'indexation ne te coûtera probablement rien.
Deux modèles méritent une mention à part.
voyage-context-4 produit des embeddings contextualisés au niveau du chunk : chaque vecteur porte le contexte du document entier sans que tu aies à bricoler des métadonnées à la main. Avec 120 000 tokens de contexte, tu peux passer un document long en une fois. Il s'appelle avec contextualized_embed() et non embed(), c'est le piège classique.
voyage-multimodal-3.5 vectorise du texte, des images et de la vidéo dans le même espace. Si ton corpus est fait de captures d'écran, de slides ou de PDF riches, c'est là qu'il faut regarder.
Le détail que personne ne mentionne : Voyage appartient à MongoDB
Voici le point que la règle du fact-check impose de vérifier, et que les articles qui recopient la doc Anthropic ratent systématiquement.
Voyage AI n'est plus une startup indépendante. MongoDB a racheté Voyage AI en février 2025 pour environ 220 millions de dollars en cash et en actions.
Est-ce que ça invalide la recommandation ? Non. L'API reste accessible en direct sur voyageai.com, ainsi que sur AWS Marketplace et Azure Marketplace, indépendamment de MongoDB. Tu n'as pas besoin d'une base MongoDB pour utiliser Voyage.
Mais tu dois l'intégrer à ton évaluation de risque fournisseur. Quand tu construis ton RAG sur un modèle d'embedding, tu ne fais pas un choix réversible en une après-midi : changer de modèle impose de réindexer tout ton corpus. Savoir que ton fournisseur est une brique dans la stratégie produit d'un éditeur de base de données, ça change la lecture. Ça peut jouer dans les deux sens, d'ailleurs : un adossement à MongoDB, c'est aussi une garantie de pérennité qu'une startup seule n'offre pas.
Les alternatives sérieuses
Anthropic te dit d'aller comparer. Voilà la comparaison.
| Fournisseur | Modèle | Prix / million de tokens | Particularité |
|---|---|---|---|
| Voyage AI | voyage-4-lite | 0,02 $ | recommandé par Anthropic, 200 M gratuits |
| OpenAI | text-embedding-3-small | 0,02 $ | l'écosystème le plus documenté |
| OpenAI | text-embedding-3-large | 0,13 $ | 3072 dimensions |
| Cohere | embed-v4 | 0,12 $ | multimodal texte et images |
gemini-embedding-001 | 0,15 $ | 3072 dimensions |
Sources tarifaires : OpenAI, Cohere, Google.
Sur les scores de qualité, je ne vais pas te donner un classement figé. Les benchmarks d'embedding bougent tous les mois et un article qui te donne un tableau MTEB sera périmé avant que tu le lises. Va voir le leaderboard MTEB sur Hugging Face, qui est mis à jour en continu, et filtre sur ta langue et ton type de tâche. Pour du contenu francophone, ne te fie surtout pas au score moyen anglais.
Et si tu veux creuser le multimodal côté Google, j'ai détaillé le pipeline complet dans mon article sur le RAG multimodal avec Gemini Embedding et Claude Code.
Comment choisir sans y passer trois jours
- Tu prototypes :
voyage-4-liteoutext-embedding-3-small. À 0,02 $ le million, le coût n'est pas un critère de décision à ce stade. Prends celui dont le SDK t'énerve le moins. - Tu es en production sur du multilingue :
voyage-4-large. C'est là que l'écart de qualité se paie et se justifie. - Ton corpus est du code :
voyage-code-3, entraîné pour la récupération de code. Un modèle généraliste sous-performe nettement sur des identifiants et de la syntaxe. - Ton corpus est juridique ou financier :
voyage-law-2ouvoyage-finance-2. Les modèles de domaine gagnent vraiment sur du vocabulaire spécialisé. - Ton corpus est fait de PDF, de slides et de captures :
voyage-multimodal-3.5ouembed-v4de Cohere. - Tu ne peux pas envoyer tes données à un tiers :
voyage-4-nano, dont les poids sont sous licence Apache 2.0 et disponibles sur Hugging Face. Tu l'héberges toi-même.
Le code qui marche
L'architecture réelle d'un RAG avec Claude, c'est deux fournisseurs : un pour vectoriser, un pour raisonner.
import os
import voyageai
import numpy as np
from anthropic import Anthropic
vo = voyageai.Client() # lit VOYAGE_API_KEY
claude = Anthropic() # lit ANTHROPIC_API_KEY
documents = [
"Le remboursement est possible sous 30 jours apres achat.",
"Nos bureaux sont fermes les jours feries francais.",
"La garantie constructeur couvre 24 mois, piece et main d'oeuvre.",
]
# 1. Indexation : input_type="document"
doc_embds = vo.embed(
documents, model="voyage-4", input_type="document"
).embeddings
# 2. Requete : input_type="query", ce n'est pas cosmetique
question = "Combien de temps dure la garantie ?"
q_embd = vo.embed(
[question], model="voyage-4", input_type="query"
).embeddings[0]
# 3. Recherche : les vecteurs Voyage sont normalises,
# le produit scalaire suffit
best = documents[int(np.argmax(np.dot(doc_embds, q_embd)))]
# 4. Claude raisonne sur le contexte recupere
reponse = claude.messages.create(
model="claude-sonnet-5",
max_tokens=512,
messages=[{
"role": "user",
"content": f"Contexte : {best}\n\nQuestion : {question}",
}],
)
print(reponse.content[0].text)
Trois pièges qui coûtent cher
Oublier input_type. C'est l'erreur la plus fréquente et la plus silencieuse. Voyage préfixe le texte avec une instruction différente selon que tu indexes un document ou que tu poses une question. La doc est catégorique : n'omets pas le paramètre et ne le mets pas à None. Sans lui, tes vecteurs sont moins bons pour la récupération, et tu ne verras jamais d'erreur, juste des résultats médiocres.
Changer de modèle sans réindexer. Deux modèles différents produisent des espaces vectoriels incompatibles, même à dimensions égales. Si tu indexes en voyage-4 et que tu requêtes en text-embedding-3-small, tu n'auras pas une erreur, tu auras du bruit. La migration d'un modèle d'embedding, c'est une réindexation complète du corpus. Prends la décision une fois, sérieusement.
Payer le stockage plein tarif. Voyage supporte la quantification via le paramètre output_dtype : int8 divise le stockage par 4, binary par 32. Sur un corpus de plusieurs millions de chunks, la facture de ta base vectorielle pèse souvent plus lourd que celle des embeddings. Les dimensions réductibles (256 au lieu de 1024) jouent dans le même sens, via les représentations Matryoshka.
Ce qu'il faut retenir
Chercher un modèle d'embedding Anthropic, c'est chercher quelque chose qui n'existe pas et qui n'existera probablement pas. Ce n'est pas un manque dans le produit, c'est un choix de périmètre assumé et documenté.
Ton RAG Claude aura toujours deux fournisseurs. Voyage AI est le choix par défaut raisonnable, surtout avec 200 millions de tokens gratuits pour démarrer. Mais lis la deuxième phrase de la doc Anthropic, celle que tout le monde saute : va comparer avant de figer ton choix, parce que revenir en arrière veut dire tout réindexer.
Pierre Rondeau
Développeur et indie builder. Je construis des produits et automatisations avec l'IA. Créateur de Claude Hub.
LinkedIn