Embeddings
Les embeddings de texte sont des représentations numériques du texte qui permettent de mesurer la similarité sémantique. Ce guide présente les embeddings, leurs applications et la manière d'utiliser les modèles d'embedding pour des tâches telles que la recherche, les recommandations et la détection d'anomalies.
Avant d'implémenter les embeddings
Lors du choix d'un fournisseur d'« embeddings » (plongements vectoriels), plusieurs facteurs peuvent être pris en compte selon vos besoins et vos préférences :
- Taille du jeu de données et spécificité du domaine : taille du jeu de données d'entraînement du modèle et sa pertinence par rapport au domaine que vous souhaitez vectoriser. Des données plus volumineuses ou plus spécifiques à un domaine produisent généralement de meilleurs embeddings dans ce domaine.
- Performances d'inférence : vitesse de recherche des embeddings et « latency » (latence) de bout en bout. Il s'agit d'une considération particulièrement importante pour les déploiements en production à grande échelle.
- Personnalisation : options de poursuite de l'entraînement sur des données privées, ou spécialisation des modèles pour des domaines très spécifiques. Cela peut améliorer les performances sur des vocabulaires uniques.
Comment obtenir des embeddings avec Anthropic
Anthropic ne propose pas son propre modèle d'embedding. Un fournisseur d'embeddings qui offre une grande variété d'options et de capacités couvrant l'ensemble des considérations précédentes est Voyage AI.
Voyage AI conçoit des modèles d'embedding à la pointe de la technologie et propose des modèles personnalisés pour des secteurs d'activité spécifiques tels que la finance et la santé, ou des modèles sur mesure ajustés par « fine-tuning » (ajustement fin) pour des clients individuels.
Le reste de ce guide concerne Voyage AI, mais vous devriez évaluer différents fournisseurs d'embeddings afin de trouver celui qui convient le mieux à votre cas d'utilisation spécifique.
Modèles disponibles
Voyage recommande d'utiliser les modèles d'embedding de texte suivants :
Voyage 4 (dernière génération)
| Modèle | Longueur de contexte | Dimension d'embedding | Description |
|---|---|---|---|
voyage-4-large | 32 000 | 1024 (par défaut), 256, 512, 2048 | La meilleure qualité de recherche généraliste et multilingue. Consultez l'article de blog Voyage 4 pour plus de détails. |
voyage-4 | 32 000 | 1024 (par défaut), 256, 512, 2048 | Optimisé pour la qualité de recherche généraliste et multilingue. Équilibre qualité et efficacité. Consultez l'article de blog Voyage 4 pour plus de détails. |
voyage-4-lite | 32 000 | 1024 (par défaut), 256, 512, 2048 | Optimisé pour la latence et le coût. Consultez l'article de blog Voyage 4 pour plus de détails. |
voyage-4-nano | 32 000 | 1024 (par défaut), 256, 512, 2048 | Modèle à poids ouverts (licence Apache 2.0) disponible sur Hugging Face. Consultez l'article de blog Voyage 4 pour plus de détails. |
Génération précédente
| Modèle | Longueur de contexte | Dimension d'embedding | Description |
|---|---|---|---|
voyage-3-large | 32 000 | 1024 (par défaut), 256, 512, 2048 | La meilleure qualité de recherche généraliste et multilingue. Consultez l'article de blog voyage-3-large pour plus de détails. |
voyage-3.5 | 32 000 | 1024 (par défaut), 256, 512, 2048 | Optimisé pour la qualité de recherche généraliste et multilingue. Consultez l'article de blog voyage-3.5 pour plus de détails. |
voyage-3.5-lite | 32 000 | 1024 (par défaut), 256, 512, 2048 | Optimisé pour la latence et le coût. Consultez l'article de blog voyage-3.5 pour plus de détails. |
voyage-code-3 | 32 000 | 1024 (par défaut), 256, 512, 2048 | Optimisé pour la recherche de code. Consultez l'article de blog voyage-code-3 pour plus de détails. |
voyage-finance-2 | 32 000 | 1024 | Optimisé pour la recherche et le RAG dans le domaine de la finance. Consultez l'article de blog voyage-finance-2 pour plus de détails. |
voyage-law-2 | 16 000 | 1024 | Optimisé pour la recherche et le RAG dans le domaine juridique et à contexte long. Performances également améliorées dans tous les domaines. Consultez l'article de blog voyage-law-2 pour plus de détails. |
De plus, Voyage recommande les modèles d'embedding multimodaux suivants :
| Modèle | Longueur de contexte | Dimension d'embedding | Description |
|---|---|---|---|
voyage-multimodal-3.5 | 32 000 | 1024 (par défaut), 256, 512, 2048 | Modèle d'embedding multimodal riche capable de vectoriser du texte, des images et des vidéos entrelacés. Inclut la prise en charge de la vidéo en tant que premier modèle d'embedding vidéo de qualité production. Consultez l'article de blog voyage-multimodal-3.5 pour plus de détails. |
voyage-multimodal-3 | 32 000 | 1024 | Modèle d'embedding multimodal riche capable de vectoriser du texte entrelacé avec des images riches en contenu, telles que des captures d'écran de PDF, des diapositives, des tableaux, des figures, et plus encore. Consultez l'article de blog voyage-multimodal-3 pour plus de détails. |
Les modèles d'embedding de segments contextualisés suivants produisent des vecteurs au niveau du segment qui capturent le contexte complet du document sans enrichissement manuel par métadonnées. Appelez ces modèles avec contextualized_embed() au lieu de embed() :
| Modèle | Longueur de contexte | Dimension d'embedding | Description |
|---|---|---|---|
voyage-context-4 | 120 000 | 1024 (par défaut), 256, 512, 2048 | Embeddings de segments contextualisés optimisés pour la qualité de recherche généraliste et multilingue. Consultez l'article de blog voyage-context-4 pour plus de détails. |
voyage-context-3 | 120 000 | 1024 (par défaut), 256, 512, 2048 | Embeddings de segments contextualisés optimisés pour la qualité de recherche généraliste et multilingue. Consultez l'article de blog voyage-context-3 pour plus de détails. |
Voyage AI propose également des « rerankers » (modèles de reclassement), qui prennent une requête et une liste de documents et les renvoient classés par pertinence par rapport à la requête. Appelez ces modèles avec rerank() :
| Modèle | Longueur de contexte | Description |
|---|---|---|
rerank-2.5 | 32 000 | Précision la plus élevée. Recommandé pour la plupart des applications. Consultez l'article de blog rerank-2.5 pour plus de détails. |
rerank-2.5-lite | 32 000 | Optimisé pour la latence et le coût. Consultez l'article de blog rerank-2.5 pour plus de détails. |
Besoin d'aide pour choisir le modèle d'embedding de texte à utiliser ? Consultez la FAQ de Voyage AI.
Premiers pas avec Voyage AI
Pour accéder aux embeddings Voyage :
- Inscrivez-vous sur le site web de Voyage AI.
- Obtenez une clé API.
- Définissez la clé API comme variable d'environnement pour plus de commodité :
export VOYAGE_API_KEY="<your secret key>"Vous pouvez obtenir les embeddings soit en utilisant le package Python voyageai officiel, soit via des requêtes HTTP, comme décrit dans les sections suivantes.
Bibliothèque Python Voyage
Installez le package voyageai à l'aide de la commande suivante :
pip install -U voyageaiEnsuite, vous pouvez créer un objet client et commencer à l'utiliser pour vectoriser vos textes :
import voyageai
vo = voyageai.Client()
# Ceci utilisera automatiquement la variable d'environnement VOYAGE_API_KEY.
# Vous pouvez aussi utiliser vo = voyageai.Client(api_key="<votre clé secrète>")
texts = ["Sample text 1", "Sample text 2"]
result = vo.embed(texts, model="voyage-4", input_type="document")
print(result.embeddings[0])
print(result.embeddings[1])result.embeddings est une liste de deux vecteurs d'embedding, chacun contenant 1024 nombres à virgule flottante. Après l'exécution du code précédent, les deux embeddings sont affichés à l'écran :
[-0.013131560757756233, 0.019828535616397858, ...] # embedding for "Sample text 1"
[-0.0069352793507277966, 0.020878976210951805, ...] # embedding for "Sample text 2"Lors de la création des embeddings, vous pouvez spécifier quelques autres arguments à la fonction embed().
Pour plus d'informations sur le package Python Voyage, consultez la documentation du package Python Voyage.
API HTTP Voyage
Vous pouvez également obtenir des embeddings en interrogeant l'API HTTP Voyage. Par exemple, vous pouvez envoyer une requête HTTP via la commande curl dans un terminal :
curl https://api.voyageai.com/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $VOYAGE_API_KEY" \
-d '{
"input": ["Sample text 1", "Sample text 2"],
"model": "voyage-4"
}'La réponse que vous obtiendrez est un objet JSON contenant les embeddings et l'utilisation des tokens :
{
"object": "list",
"data": [
{
"embedding": [-0.013131560757756233, 0.019828535616397858 /* ... */],
"index": 0
},
{
"embedding": [-0.0069352793507277966, 0.020878976210951805 /* ... */],
"index": 1
}
],
"model": "voyage-4",
"usage": {
"total_tokens": 10
}
}Pour plus d'informations sur l'API HTTP Voyage, consultez la documentation de l'API HTTP Voyage.
AWS Marketplace
Les embeddings Voyage sont disponibles sur AWS Marketplace. Les instructions pour accéder à Voyage sur AWS sont disponibles dans la documentation Voyage AWS Marketplace.
Exemple de démarrage rapide
Le bref exemple suivant montre comment utiliser les embeddings.
Supposons que vous disposiez d'un petit corpus de six documents dans lequel effectuer des recherches
documents = [
"The Mediterranean diet emphasizes fish, olive oil, and vegetables, believed to reduce chronic diseases.",
"Photosynthesis in plants converts light energy into glucose and produces essential oxygen.",
"20th-century innovations, from radios to smartphones, centered on electronic advancements.",
"Rivers provide water, irrigation, and habitat for aquatic species, vital for ecosystems.",
"Apple's conference call to discuss fourth fiscal quarter results and business updates is scheduled for Thursday, November 2, 2023 at 2:00 p.m. PT / 5:00 p.m. ET.",
"Shakespeare's works, like 'Hamlet' and 'A Midsummer Night's Dream,' endure in literature.",
]Tout d'abord, utilisez Voyage pour convertir chaque document en un vecteur d'embedding.
import voyageai
vo = voyageai.Client()
# Générer les embeddings des documents
doc_embds = vo.embed(documents, model="voyage-4", input_type="document").embeddingsLes embeddings vous permettent d'effectuer une recherche sémantique / récupération dans l'espace vectoriel. Étant donné un exemple de requête,
query = "When is Apple's conference call scheduled?"Ensuite, convertissez-la en embedding et effectuez une recherche du plus proche voisin pour trouver le document le plus pertinent en fonction de la distance dans l'espace d'embedding.
import numpy as np
# Générer l'embedding de la requête
query_embd = vo.embed([query], model="voyage-4", input_type="query").embeddings[0]
# Calculer la similarité
# Les embeddings Voyage sont normalisés à une longueur de 1, donc le produit scalaire
# et la similarité cosinus sont identiques.
similarities = np.dot(doc_embds, query_embd)
retrieved_id = np.argmax(similarities)
print(documents[retrieved_id])Notez que input_type="document" et input_type="query" sont utilisés pour vectoriser respectivement le document et la requête. Vous trouverez plus de précisions dans la section Bibliothèque Python Voyage.
La sortie est le cinquième document, qui est effectivement le plus pertinent pour la requête :
Apple's conference call to discuss fourth fiscal quarter results and business updates is scheduled for Thursday, November 2, 2023 at 2:00 p.m. PT / 5:00 p.m. ET.Si vous recherchez un ensemble détaillé de recettes sur la manière de faire du RAG avec des embeddings, y compris avec des bases de données vectorielles, consultez la recette RAG.
FAQ
Les modèles d'embedding s'appuient sur de puissants réseaux de neurones pour capturer et compresser le contexte sémantique, à l'instar des modèles génératifs. L'équipe de chercheurs en IA expérimentés de Voyage optimise chaque composant du processus d'embedding, notamment :
- L'architecture du modèle
- La collecte de données
- Les fonctions de perte
- Le choix de l'optimiseur
Apprenez-en davantage sur l'approche technique de Voyage sur le blog de Voyage AI.
Pour l'embedding généraliste, les modèles recommandés sont :
voyage-4-large: meilleure qualitévoyage-4-lite: latence et coût les plus faiblesvoyage-4: performances équilibrées
Pour la recherche, utilisez le paramètre input_type pour spécifier si le texte est de type requête ou document.
Modèles spécifiques à un domaine :
- Tâches juridiques :
voyage-law-2 - Code et documentation de programmation :
voyage-code-3 - Tâches liées à la finance :
voyage-finance-2
Pour la recherche au niveau du segment et au niveau du document : voyage-context-4
Vous pouvez utiliser les embeddings Voyage avec la similarité par produit scalaire, la similarité cosinus ou la distance euclidienne. Pour une explication de la similarité des embeddings, consultez ce guide sur la similarité vectorielle.
Les embeddings Voyage AI sont normalisés à une longueur de 1, ce qui signifie que :
- La similarité cosinus est équivalente à la similarité par produit scalaire, cette dernière pouvant être calculée plus rapidement.
- La similarité cosinus et la distance euclidienne produisent des classements identiques.
Consultez le guide de tokenisation de Voyage.
Pour toutes les tâches et tous les cas d'utilisation de recherche (par exemple, le RAG), utilisez le paramètre input_type pour spécifier si le texte d'entrée est une requête ou un document. N'omettez pas input_type et ne définissez pas input_type=None. Spécifier si le texte d'entrée est une requête ou un document permet de créer de meilleures représentations vectorielles denses pour la recherche, ce qui peut conduire à une meilleure qualité de recherche.
Lors de l'utilisation du paramètre input_type, des prompts spéciaux sont ajoutés au début du texte d'entrée avant l'embedding. Plus précisément :
📘 Prompts associés à
input_type
- Pour une requête, le prompt est « Represent the query for retrieving supporting documents: ».
- Pour un document, le prompt est « Represent the document for retrieval: ».
- Exemple
- Lorsque
input_type="query", une requête telle que « When is Apple's conference call scheduled? » deviendra « Represent the query for retrieving supporting documents: When is Apple's conference call scheduled? »- Lorsque
input_type="document", une requête telle que « Apple's conference call to discuss fourth fiscal quarter results and business updates is scheduled for Thursday, November 2, 2023 at 2:00 p.m. PT / 5:00 p.m. ET. » deviendra « Represent the document for retrieval: Apple's conference call to discuss fourth fiscal quarter results and business updates is scheduled for Thursday, November 2, 2023 at 2:00 p.m. PT / 5:00 p.m. ET. »
voyage-large-2-instruct, comme son nom l'indique, est entraîné pour répondre à des instructions supplémentaires ajoutées au début du texte d'entrée. Pour la classification, le clustering ou d'autres sous-tâches MTEB, utilisez les instructions de voyage-large-2-instruct.
La quantification des embeddings convertit des valeurs de haute précision, telles que des nombres à virgule flottante simple précision sur 32 bits, en formats de précision inférieure tels que des entiers sur 8 bits ou des valeurs binaires sur 1 bit, réduisant ainsi le stockage, la mémoire et les coûts d'un facteur 4 et 32, respectivement. Les modèles Voyage pris en charge permettent la quantification en spécifiant le type de données de sortie avec le paramètre output_dtype :
float: chaque embedding renvoyé est une liste de nombres à virgule flottante simple précision sur 32 bits (4 octets). Il s'agit de la valeur par défaut, qui offre la précision / l'exactitude de recherche la plus élevée.int8etuint8: chaque embedding renvoyé est une liste d'entiers sur 8 bits (1 octet) allant respectivement de -128 à 127 et de 0 à 255.binaryetubinary: chaque embedding renvoyé est une liste d'entiers sur 8 bits qui représentent des valeurs d'embedding sur un seul bit, quantifiées et compactées par bits :int8pourbinaryetuint8pourubinary. La longueur de la liste d'entiers renvoyée est égale à 1/8 de la dimension réelle de l'embedding. Le type binaire utilise la méthode du binaire décalé, sur laquelle vous pouvez en apprendre davantage dans la FAQ sur les embeddings.
Exemple de quantification binaire
Considérez les huit valeurs d'embedding suivantes : -0.03955078, 0.006214142, -0.07446289, -0.039001465, 0.0046463013, 0.00030612946, -0.08496094 et 0.03994751. Avec la quantification binaire, les valeurs inférieures ou égales à zéro seront quantifiées en un zéro binaire, et les valeurs positives en un un binaire, ce qui donne la séquence binaire suivante : 0, 1, 0, 0, 1, 1, 0, 1. Ces huit bits sont ensuite compactés en un seul entier sur 8 bits, 01001101 (le bit le plus à gauche étant le bit de poids fort).
ubinary: la séquence binaire est directement convertie et représentée sous forme d'entier non signé (uint8) 77.binary: la séquence binaire est représentée sous forme d'entier signé (int8) -51, calculé à l'aide de la méthode du binaire décalé (77 - 128 = -51).
L'apprentissage Matryoshka crée des embeddings avec des représentations allant du grossier au fin au sein d'un seul vecteur. Les modèles Voyage, tels que voyage-code-3, qui prennent en charge plusieurs dimensions de sortie génèrent de tels embeddings Matryoshka. Vous pouvez tronquer ces vecteurs en conservant le sous-ensemble initial de dimensions. Par exemple, le code Python suivant montre comment tronquer des vecteurs de 1024 dimensions à 256 dimensions :
import voyageai
import numpy as np
def embd_normalize(v: np.ndarray) -> np.ndarray:
"""
Normalize the rows of a 2D numpy array to unit vectors by dividing each row by its Euclidean
norm. Raises a ValueError if any row has a norm of zero to prevent division by zero.
"""
row_norms = np.linalg.norm(v, axis=1, keepdims=True)
if np.any(row_norms == 0):
raise ValueError("Cannot normalize rows with a norm of zero.")
return v / row_norms
vo = voyageai.Client()
# Générer des vecteurs voyage-code-3, qui sont par défaut des nombres à virgule flottante de dimension 1024
embd = vo.embed(["Sample text 1", "Sample text 2"], model="voyage-code-3").embeddings
# Définir une dimension plus courte
short_dim = 256
# Redimensionner et normaliser les vecteurs à la dimension plus courte
resized_embd = embd_normalize(np.array(embd)[:, :short_dim]).tolist()Tarification
Consultez la page de tarification de Voyage pour obtenir les informations tarifaires les plus récentes.
Was this page helpful?