Les termes du cours, en français et en anglais, avec la définition qu'un ingénieur peut utiliser. Gardez cette page ouverte : la documentation officielle est presque toujours en anglais, les échanges d'équipe souvent en français.The course's terms, in French and English, with the definition an engineer can actually use. Keep this page open: official documentation is almost always in English, while team discussions are often in French.
1. FondamentauxFoundations
FrançaisFrench
English
DéfinitionDefinition
Modèle de langage
Language model (LLM)
Réseau de neurones entraîné à prédire le token suivant. Ne « sait » rien : il prédit.A neural network trained to predict the next token. It "knows" nothing: it predicts.
Jeton / Token
Token
Fragment de mot transformé en entier. Unité de coût, de vitesse et de contexte.A word fragment turned into an integer. The unit of cost, speed and context.
Tokeniseur
Tokenizer
Algorithme (BPE) qui découpe le texte en tokens. Propre à chaque famille de modèles.Algorithm (BPE) splitting text into tokens. Specific to each model family.
Fenêtre de contexte
Context window
Nombre maximal de tokens (prompt + réponse) que le modèle traite d'un coup.Maximum number of tokens (prompt + answer) the model handles at once.
Plongement
Embedding
Vecteur représentant le sens d'un texte. Base de la recherche sémantique et du RAG.A vector representing a text's meaning. The basis of semantic search and RAG.
Similarité cosinus
Cosine similarity
Mesure de proximité entre deux vecteurs (cosinus de l'angle, de −1 à 1).A closeness measure between two vectors (cosine of the angle, −1 to 1).
Paramètre / Poids
Parameter / Weight
Un nombre du réseau. « 8 B » = 8 milliards de poids.A number in the network. "8 B" = 8 billion weights.
Auto-attention
Self-attention
Mécanisme permettant à chaque token de pondérer tous les autres. Cœur du Transformer.Mechanism letting each token weight all others. The heart of the Transformer.
Hallucination
Hallucination
Affirmation fausse énoncée avec assurance. Propriété du système, pas un bug.A false statement asserted confidently. A property of the system, not a bug.
Gabarit de conversation
Chat template
Format exact des messages attendu par le modèle. Un mauvais gabarit sabote silencieusement le fine-tuning.The exact message format the model expects. A wrong template silently sabotages fine-tuning.
2. Mémoire & quantificationMemory & quantization
FrançaisFrench
English
DéfinitionDefinition
Quantification
Quantization
Réduire le nombre de bits par poids (FP16 → 4 bits). Moins d'octets = plus rapide et plus petit.Reducing bits per weight (FP16 → 4 bits). Fewer bytes = faster and smaller.
Cache KV
KV cache
Mémoire des clés/valeurs d'attention. Croît linéairement avec la longueur du contexte.Memory for attention keys/values. Grows linearly with context length.
Têtes KV
KV heads
Sous-ensemble des têtes d'attention qui portent le cache (GQA). Toujours utiliser ce nombre dans le calcul.The subset of attention heads carrying the cache (GQA). Always use this number in the calculation.
GQA — attention à requêtes groupées
Grouped-query attention
Plusieurs têtes d'attention partagent une tête KV. Rend le contexte long abordable.Several attention heads share one KV head. Makes long context affordable.
Préremplissage
Prefill
Traitement du prompt entier. Parallélisable, limité par le calcul. Détermine le TTFT.Processing the whole prompt. Parallelisable, compute-limited. Sets TTFT.
Décodage
Decode
Génération token par token. Non parallélisable, limité par la bande passante mémoire.Token-by-token generation. Not parallelisable, memory-bandwidth-limited.
Limité par la mémoire
Memory-bound
Le goulot est le transport des données, pas le calcul. Cas du décodage.The bottleneck is data movement, not compute. The case for decoding.
Déport GPU
GPU offload
Placer N couches sur GPU (-ngl, num_gpu). Le levier n°1 de performance.Placing N layers on GPU (-ngl, num_gpu). The #1 performance lever.
Réutilisation de préfixe
Prefix reuse / prompt caching
Sauter le prefill quand le début du prompt est identique. Effet massif sur le TTFT d'un RAG.Skipping prefill when the prompt's start is identical. Huge effect on RAG TTFT.
3. Prompt & évaluationPrompting & evaluation
FrançaisFrench
English
DéfinitionDefinition
Prompt système
System prompt
Le contrat permanent, envoyé à chaque appel. Son coût se multiplie par la volumétrie.The permanent contract, sent on every call. Its cost multiplies with volume.
Quelques exemples
Few-shot
Fournir des exemples entrée→sortie dans le prompt. Choisir les cas difficiles.Providing input→output examples in the prompt. Choose hard cases.
Sortie contrainte
Constrained / structured output
Forcer la forme de la sortie (schéma JSON, grammaire). Garantit la forme, pas le contenu.Forcing the output's shape (JSON schema, grammar). Guarantees shape, not content.
Injection de prompt
Prompt injection
Texte qui se fait passer pour une instruction. La variante indirecte vient de vos documents.Text impersonating an instruction. The indirect variant comes from your documents.
Jeu de cas / jeu d'or
Golden set
Cas de test avec la sortie attendue. La base de toute évaluation.Test cases with expected output. The basis of any evaluation.
Harnais d'évaluation
Evaluation harness
Script qui rejoue un prompt sur un jeu de cas et produit des scores.A script replaying a prompt over a case set and producing scores.
Régression
Regression
Rejouer tout le jeu de cas après chaque modification. Sinon on « améliore » en cassant.Replaying all cases after every change. Otherwise you "improve" by breaking things.
Juge LLM
LLM-as-judge
Utiliser un modèle pour noter une réponse. Biaisé : à calibrer sur des jugements humains.Using a model to score an answer. Biased: calibrate against human judgements.
4. RAG
FrançaisFrench
English
DéfinitionDefinition
Découpage
Chunking
Découper les documents en fragments indexables. À dimensionner sur la fenêtre d'embedding.Splitting documents into indexable chunks. Size it to the embedding window.
Base vectorielle
Vector database
Stocke vecteurs + métadonnées (Chroma, Qdrant) et permet la recherche.Stores vectors + metadata (Chroma, Qdrant) and enables search.
Recherche hybride
Hybrid search
Combiner recherche dense (sens) et lexicale (termes exacts). Le meilleur choix en pratique.Combining dense (meaning) and lexical (exact terms) search. The best practical choice.
Reclassement
Reranking
Re-trier les k candidats avec un modèle plus fin. Récupérer large, garder peu.Re-ordering the k candidates with a finer model. Retrieve wide, keep few.
Rappel@k
Recall@k
Le bon fragment est-il dans les k récupérés ? Mesure l'étage récupération.Is the right chunk among the k retrieved? Measures the retrieval stage.
Fidélité
Faithfulness
La réponse est-elle fidèle aux extraits fournis ? Mesure l'étage génération.Is the answer faithful to the supplied excerpts? Measures the generation stage.
Récupération du document parent
Parent-document retrieval
Indexer de petits fragments pour chercher, fournir le document entier pour répondre.Index small chunks to search, supply the whole document to answer.
5. Fine-tuningFine-tuning
FrançaisFrench
English
DéfinitionDefinition
Réglage fin
Fine-tuning
Poursuivre l'entraînement d'un modèle sur vos données pour changer un comportement.Continuing a model's training on your data to change a behaviour.
Ajustement supervisé
Supervised fine-tuning (SFT)
Étape 2 de l'entraînement : apprendre à répondre instruction→réponse. C'est là qu'on intervient.Training stage 2: learning to answer instruction→response. That is where you step in.
LoRA — adaptation de rang faible
Low-Rank Adaptation
Geler la base et n'entraîner que deux petites matrices. 0,1–1 % des paramètres.Freeze the base and train only two small matrices. 0.1–1 % of parameters.
Adaptateur
Adapter
Le fichier produit par LoRA (quelques dizaines de Mo). Versionnable et réversible.The file produced by LoRA (a few tens of MB). Versionable and reversible.
QLoRA
QLoRA
Base chargée en 4 bits (NF4) + adaptateurs en précision plus élevée. Permet le fine-tuning sur 12 Go.Base loaded in 4 bits (NF4) + higher-precision adapters. Enables fine-tuning on 12 GB.
Rang (r)
Rank (r)
Capacité de l'adaptateur. Départ classique : 16, avec alpha = 2 × r.Adapter capacity. Classic start: 16, with alpha = 2 × r.
Sur-apprentissage
Overfitting
La perte de validation remonte pendant que celle d'entraînement descend. Signal d'arrêt.Validation loss rises while training loss falls. Stop signal.
Oubli catastrophique
Catastrophic forgetting
Le modèle excelle sur votre tâche et perd ses capacités générales. Parade : mélanger 10–20 % de données générales.The model excels at your task and loses general abilities. Countermeasure: mix in 10–20 % general data.
Fusion
Merge
Replier l'adaptateur dans les poids de base (merge_and_unload) pour obtenir un modèle autonome.Folding the adapter into the base weights (merge_and_unload) for a self-contained model.
6. DéploiementDeployment
FrançaisFrench
English
DéfinitionDefinition
GGUF
GGUF
Format de fichier des modèles pour llama.cpp : métadonnées + tenseurs quantifiés.The model file format for llama.cpp: metadata + quantized tensors.
Fichier de modèle
Modelfile
Recette d'un modèle Ollama : FROM, ADAPTER, PARAMETER, SYSTEM.An Ollama model recipe: FROM, ADAPTER, PARAMETER, SYSTEM.
Compatible OpenAIOpenAI-compatible
OpenAI-compatible API
Même forme de requête/réponse — pas le même comportement ni les mêmes noms de modèles.Same request/response shape — not the same behaviour or model names.
TTFT
Time to first token
Délai avant le premier token. Détermine la perception de vitesse.Delay before the first token. Determines perceived speed.
Démarrage à froidCold start
Cold start
Temps de chargement du modèle. À exclure des mesures de latence, à documenter comme disponibilité.Model loading time. Exclude it from latency measurements, document it as availability.
💡 Conseil de rédaction bilingue : dans un document technique français, gardez les termes anglais entre parenthèses à la première occurrence — « quantification (quantization) ». Les équipes mélangent les deux, et une recherche de documentation se fait en anglais. L'inverse (document anglais avec termes français) est rarement nécessaire.Bilingual writing tip: in a French technical document, keep English terms in brackets at first occurrence — "quantification (quantization)". Teams mix the two, and documentation searches happen in English. The reverse (English document with French terms) is rarely needed.