Qu'est-ce que le Top-k en intelligence artificielle ?
Définition technique du Top-k
Le Top-k est un algorithme de filtrage probabiliste appliqué lors de l'inférence des modèles de langage (LLM). Son rôle est de classer les jetons candidats par score de probabilité après le calcul de la distribution Softmax.
Une fois le classement effectué, seuls les 'k' jetons les plus probables sont conservés. Le modèle procède ensuite à un nouvel échantillonnage uniquement parmi ces candidats, écartant ainsi la longue traîne des mots peu probables.
Le rôle du Top-k dans la génération de texte
Le choix de la valeur k est un levier fondamental pour contrôler le comportement d'un modèle. Un k faible force le modèle à choisir parmi les jetons les plus sûrs, ce qui rend le texte très cohérent mais potentiellement répétitif.
À l'inverse, un k élevé augmente la diversité lexicale en incluant des options moins probables. Cela favorise la créativité, mais augmente également le risque de produire des phrases incohérentes ou des hallucinations textuelles.
Top-k vs Top-p (Nucleus Sampling)
Alors que le Top-k fixe un nombre absolu de candidats, le Top-p (ou Nucleus Sampling) sélectionne un ensemble dynamique de jetons dont la probabilité cumulée atteint un seuil défini.
L'usage combiné de ces méthodes est fréquent dans les systèmes de production pour stabiliser la génération. Le Top-k agit souvent comme une première couche de filtrage avant l'application du Top-p.
Exemple pratique d'application
Imaginons que le modèle doive compléter la phrase : 'Le ciel est...'. La distribution des probabilités pourrait attribuer 60% à 'bleu', 20% à 'nuageux', 10% à 'gris', et 1% à des termes comme 'tomate' ou 'ferreux'.
Avec un Top-k réglé sur 3, le modèle ignorera totalement 'tomate' et 'ferreux'. Le choix final se fera uniquement parmi 'bleu', 'nuageux' et 'gris', garantissant une pertinence sémantique immédiate.
Limites et défis du Top-k
La difficulté principale réside dans le réglage fixe du paramètre k. Dans certains contextes linguistiques, le nombre de candidats pertinents peut varier drastiquement, rendant un k fixe soit trop restrictif, soit trop permissif.
Pour pallier cette rigidité, les ingénieurs privilégient souvent des stratégies d'échantillonnage adaptatives ou la combinaison avec des paramètres comme la Température, qui lisse la distribution des probabilités avant le filtrage.