Glossaire bilingueBilingual glossary

Les termes du cours, en français et en anglais, avec la définition qu'un ingénieur peut utiliser. Gardez cette page ouverte : la documentation officielle est presque toujours en anglais, les échanges d'équipe souvent en français. The course's terms, in French and English, with the definition an engineer can actually use. Keep this page open: official documentation is almost always in English, while team discussions are often in French.

1. FondamentauxFoundations

FrançaisFrenchEnglishDéfinitionDefinition
Modèle de langageLanguage model (LLM)Réseau de neurones entraîné à prédire le token suivant. Ne « sait » rien : il prédit.A neural network trained to predict the next token. It "knows" nothing: it predicts.
Jeton / TokenTokenFragment de mot transformé en entier. Unité de coût, de vitesse et de contexte.A word fragment turned into an integer. The unit of cost, speed and context.
TokeniseurTokenizerAlgorithme (BPE) qui découpe le texte en tokens. Propre à chaque famille de modèles.Algorithm (BPE) splitting text into tokens. Specific to each model family.
Fenêtre de contexteContext windowNombre maximal de tokens (prompt + réponse) que le modèle traite d'un coup.Maximum number of tokens (prompt + answer) the model handles at once.
PlongementEmbeddingVecteur représentant le sens d'un texte. Base de la recherche sémantique et du RAG.A vector representing a text's meaning. The basis of semantic search and RAG.
Similarité cosinusCosine similarityMesure de proximité entre deux vecteurs (cosinus de l'angle, de −1 à 1).A closeness measure between two vectors (cosine of the angle, −1 to 1).
Paramètre / PoidsParameter / WeightUn nombre du réseau. « 8 B » = 8 milliards de poids.A number in the network. "8 B" = 8 billion weights.
Auto-attentionSelf-attentionMécanisme permettant à chaque token de pondérer tous les autres. Cœur du Transformer.Mechanism letting each token weight all others. The heart of the Transformer.
HallucinationHallucinationAffirmation fausse énoncée avec assurance. Propriété du système, pas un bug.A false statement asserted confidently. A property of the system, not a bug.
Gabarit de conversationChat templateFormat exact des messages attendu par le modèle. Un mauvais gabarit sabote silencieusement le fine-tuning.The exact message format the model expects. A wrong template silently sabotages fine-tuning.

2. Mémoire & quantificationMemory & quantization

FrançaisFrenchEnglishDéfinitionDefinition
QuantificationQuantizationRéduire le nombre de bits par poids (FP16 → 4 bits). Moins d'octets = plus rapide et plus petit.Reducing bits per weight (FP16 → 4 bits). Fewer bytes = faster and smaller.
Cache KVKV cacheMémoire des clés/valeurs d'attention. Croît linéairement avec la longueur du contexte.Memory for attention keys/values. Grows linearly with context length.
Têtes KVKV headsSous-ensemble des têtes d'attention qui portent le cache (GQA). Toujours utiliser ce nombre dans le calcul.The subset of attention heads carrying the cache (GQA). Always use this number in the calculation.
GQA — attention à requêtes groupéesGrouped-query attentionPlusieurs têtes d'attention partagent une tête KV. Rend le contexte long abordable.Several attention heads share one KV head. Makes long context affordable.
PréremplissagePrefillTraitement du prompt entier. Parallélisable, limité par le calcul. Détermine le TTFT.Processing the whole prompt. Parallelisable, compute-limited. Sets TTFT.
DécodageDecodeGénération token par token. Non parallélisable, limité par la bande passante mémoire.Token-by-token generation. Not parallelisable, memory-bandwidth-limited.
Limité par la mémoireMemory-boundLe goulot est le transport des données, pas le calcul. Cas du décodage.The bottleneck is data movement, not compute. The case for decoding.
Déport GPUGPU offloadPlacer N couches sur GPU (-ngl, num_gpu). Le levier n°1 de performance.Placing N layers on GPU (-ngl, num_gpu). The #1 performance lever.
Réutilisation de préfixePrefix reuse / prompt cachingSauter le prefill quand le début du prompt est identique. Effet massif sur le TTFT d'un RAG.Skipping prefill when the prompt's start is identical. Huge effect on RAG TTFT.

3. Prompt & évaluationPrompting & evaluation

FrançaisFrenchEnglishDéfinitionDefinition
Prompt systèmeSystem promptLe contrat permanent, envoyé à chaque appel. Son coût se multiplie par la volumétrie.The permanent contract, sent on every call. Its cost multiplies with volume.
Quelques exemplesFew-shotFournir des exemples entrée→sortie dans le prompt. Choisir les cas difficiles.Providing input→output examples in the prompt. Choose hard cases.
Sortie contrainteConstrained / structured outputForcer la forme de la sortie (schéma JSON, grammaire). Garantit la forme, pas le contenu.Forcing the output's shape (JSON schema, grammar). Guarantees shape, not content.
Injection de promptPrompt injectionTexte qui se fait passer pour une instruction. La variante indirecte vient de vos documents.Text impersonating an instruction. The indirect variant comes from your documents.
Jeu de cas / jeu d'orGolden setCas de test avec la sortie attendue. La base de toute évaluation.Test cases with expected output. The basis of any evaluation.
Harnais d'évaluationEvaluation harnessScript qui rejoue un prompt sur un jeu de cas et produit des scores.A script replaying a prompt over a case set and producing scores.
RégressionRegressionRejouer tout le jeu de cas après chaque modification. Sinon on « améliore » en cassant.Replaying all cases after every change. Otherwise you "improve" by breaking things.
Juge LLMLLM-as-judgeUtiliser un modèle pour noter une réponse. Biaisé : à calibrer sur des jugements humains.Using a model to score an answer. Biased: calibrate against human judgements.

4. RAG

FrançaisFrenchEnglishDéfinitionDefinition
DécoupageChunkingDécouper les documents en fragments indexables. À dimensionner sur la fenêtre d'embedding.Splitting documents into indexable chunks. Size it to the embedding window.
Base vectorielleVector databaseStocke vecteurs + métadonnées (Chroma, Qdrant) et permet la recherche.Stores vectors + metadata (Chroma, Qdrant) and enables search.
Recherche hybrideHybrid searchCombiner recherche dense (sens) et lexicale (termes exacts). Le meilleur choix en pratique.Combining dense (meaning) and lexical (exact terms) search. The best practical choice.
ReclassementRerankingRe-trier les k candidats avec un modèle plus fin. Récupérer large, garder peu.Re-ordering the k candidates with a finer model. Retrieve wide, keep few.
Rappel@kRecall@kLe bon fragment est-il dans les k récupérés ? Mesure l'étage récupération.Is the right chunk among the k retrieved? Measures the retrieval stage.
FidélitéFaithfulnessLa réponse est-elle fidèle aux extraits fournis ? Mesure l'étage génération.Is the answer faithful to the supplied excerpts? Measures the generation stage.
Récupération du document parentParent-document retrievalIndexer de petits fragments pour chercher, fournir le document entier pour répondre.Index small chunks to search, supply the whole document to answer.

5. Fine-tuningFine-tuning

FrançaisFrenchEnglishDéfinitionDefinition
Réglage finFine-tuningPoursuivre l'entraînement d'un modèle sur vos données pour changer un comportement.Continuing a model's training on your data to change a behaviour.
Ajustement superviséSupervised fine-tuning (SFT)Étape 2 de l'entraînement : apprendre à répondre instruction→réponse. C'est là qu'on intervient.Training stage 2: learning to answer instruction→response. That is where you step in.
LoRA — adaptation de rang faibleLow-Rank AdaptationGeler la base et n'entraîner que deux petites matrices. 0,1–1 % des paramètres.Freeze the base and train only two small matrices. 0.1–1 % of parameters.
AdaptateurAdapterLe fichier produit par LoRA (quelques dizaines de Mo). Versionnable et réversible.The file produced by LoRA (a few tens of MB). Versionable and reversible.
QLoRAQLoRABase chargée en 4 bits (NF4) + adaptateurs en précision plus élevée. Permet le fine-tuning sur 12 Go.Base loaded in 4 bits (NF4) + higher-precision adapters. Enables fine-tuning on 12 GB.
Rang (r)Rank (r)Capacité de l'adaptateur. Départ classique : 16, avec alpha = 2 × r.Adapter capacity. Classic start: 16, with alpha = 2 × r.
Sur-apprentissageOverfittingLa perte de validation remonte pendant que celle d'entraînement descend. Signal d'arrêt.Validation loss rises while training loss falls. Stop signal.
Oubli catastrophiqueCatastrophic forgettingLe modèle excelle sur votre tâche et perd ses capacités générales. Parade : mélanger 10–20 % de données générales.The model excels at your task and loses general abilities. Countermeasure: mix in 10–20 % general data.
FusionMergeReplier l'adaptateur dans les poids de base (merge_and_unload) pour obtenir un modèle autonome.Folding the adapter into the base weights (merge_and_unload) for a self-contained model.

6. DéploiementDeployment

FrançaisFrenchEnglishDéfinitionDefinition
GGUFGGUFFormat de fichier des modèles pour llama.cpp : métadonnées + tenseurs quantifiés.The model file format for llama.cpp: metadata + quantized tensors.
Fichier de modèleModelfileRecette d'un modèle Ollama : FROM, ADAPTER, PARAMETER, SYSTEM.An Ollama model recipe: FROM, ADAPTER, PARAMETER, SYSTEM.
Compatible OpenAIOpenAI-compatibleOpenAI-compatible APIMême forme de requête/réponse — pas le même comportement ni les mêmes noms de modèles.Same request/response shape — not the same behaviour or model names.
TTFTTime to first tokenDélai avant le premier token. Détermine la perception de vitesse.Delay before the first token. Determines perceived speed.
Démarrage à froidCold startCold startTemps de chargement du modèle. À exclure des mesures de latence, à documenter comme disponibilité.Model loading time. Exclude it from latency measurements, document it as availability.
Fiche de modèleModel cardModel cardBase, dataset + hash, hyperparamètres, scores, retour arrière, limites connues.Base, dataset + hash, hyperparameters, scores, rollback, known limits.
💡 Conseil de rédaction bilingue : dans un document technique français, gardez les termes anglais entre parenthèses à la première occurrence — « quantification (quantization) ». Les équipes mélangent les deux, et une recherche de documentation se fait en anglais. L'inverse (document anglais avec termes français) est rarement nécessaire. Bilingual writing tip: in a French technical document, keep English terms in brackets at first occurrence — "quantification (quantization)". Teams mix the two, and documentation searches happen in English. The reverse (English document with French terms) is rarely needed.