

La température est un paramètre numérique (généralement entre 0 et 2) qui contrôle le degré d'aléatoire dans les réponses d'un modèle de langage. À chaque étape de la génération, le modèle calcule une probabilité pour chaque token possible. La température modifie la distribution de ces probabilités avant de choisir le token suivant.
À température basse (0 à 0,3), le modèle choisit presque toujours le token le plus probable. Les réponses sont prévisibles, cohérentes, factuelles et reproductibles. Si vous posez la même question deux fois, vous obtiendrez des réponses quasi identiques. À température élevée (0,8 à 1,5), le modèle donne plus de chances aux tokens moins probables d'être sélectionnés. Les réponses sont plus variées, créatives, surprenantes, mais aussi potentiellement moins cohérentes et plus sujettes aux hallucinations.
L'analogie la plus parlante est celle d'un curseur entre fiabilité et créativité. Imaginons que vous demandez au modèle de compléter la phrase "Le ciel est..." À température 0, il choisira presque toujours "bleu" (le mot le plus statistiquement probable). À température 0,7, il pourrait répondre "bleu", "couvert", "magnifique" ou "chargé" selon le contexte. À température 1,5, il pourrait produire "bleu comme l'encre d'un poète insomniaque" ou des associations plus inattendues.
Pour une rédaction factuelle (résumé de document, extraction de données, réponse FAQ), une température basse (0 à 0,3) est recommandée. Le modèle reste fidèle au contenu source et évite les embellissements. Pour de la rédaction créative (brainstorming, copywriting, slogans, storytelling), une température moyenne à haute (0,7 à 1,2) produit des résultats plus originaux et variés. Pour de la génération de code, une température très basse (0 à 0,2) est presque toujours préférable : en code, la "créativité" se traduit par des bugs.
L'analyse de documents, l'extraction d'information et le Q&A factuel fonctionnent mieux à température 0 à 0,2. Les résumés et comptes-rendus à 0,2 à 0,4. La rédaction d'emails professionnels à 0,3 à 0,5. La rédaction marketing et les articles de blog à 0,6 à 0,8. Le brainstorming et la génération d'idées à 0,8 à 1,0. La création de slogans, de concepts créatifs et de fiction à 1,0 à 1,3.
Au-delà de 1,5, les résultats deviennent généralement incohérents et inutilisables pour la plupart des cas d'usage professionnels. La zone "sweet spot" pour un usage quotidien se situe entre 0,5 et 0,8, ce qui correspond au paramétrage par défaut de la plupart des interfaces (ChatGPT, Claude).
La température n'est pas le seul paramètre qui contrôle l'aléatoire. Le Top-p (nucleus sampling) est un paramètre complémentaire qui limite les tokens candidats à ceux dont la probabilité cumulée atteint un seuil donné. À Top-p 0,9, le modèle ne considère que les tokens qui représentent 90% de la masse probabilistique, éliminant les tokens très improbables. Combiné avec la température, le Top-p offre un contrôle fin sur le comportement du modèle.
Le Top-k est une variante plus simple qui limite le choix aux k tokens les plus probables. Le Frequency penalty pénalise les tokens déjà utilisés pour éviter les répétitions. Le Presence penalty encourage le modèle à aborder de nouveaux sujets. En pratique, pour la majorité des usages professionnels, ajuster uniquement la température suffit. Les paramètres avancés sont utiles pour des cas très spécifiques ou des applications via API.
Dans ChatGPT, la température n'est pas directement ajustable dans l'interface de chat standard. Elle est accessible via les GPTs personnalisés (dans les instructions) et via l'API. La température par défaut de ChatGPT est d'environ 0,7. Dans Claude, elle n'est pas non plus ajustable dans l'interface web mais l'est via l'API (défaut à 1,0). Dans l'API OpenAI et Anthropic, la température est un paramètre explicite de chaque requête. Les plateformes no-code comme Make et n8n permettent aussi de la configurer quand elles appellent les APIs des modèles.
Pour contourner l'absence de réglage direct dans les interfaces grand public, vous pouvez influencer le comportement du modèle via le prompting. Des instructions comme "Sois factuel et concis, ne brode pas" simulent l'effet d'une température basse. "Sois créatif et propose des idées inattendues" simule l'effet d'une température élevée. Ce n'est pas aussi précis que le réglage du paramètre, mais c'est suffisant pour la plupart des usages.
La température et les paramètres de génération sont couverts dans nos formations ChatGPT avancé et dans les modules API de nos formations Agents IA. Catalogue Almera, certifié Qualiopi, finançable OPCO.
Au-delà de la définition, ces concepts prennent toute leur valeur quand ils sont appliqués à des cas d'usage métier concrets. Almera accompagne les grands comptes (Eli Lilly, Havas, Carrefour, Orange, Eiffage) sur la transformation IA en entreprise, du diagnostic au déploiement d'agents IA métiers. Consultez nos cas clients pour voir des résultats mesurés.