En quoi consiste le Text Chunker ?
Text Chunker (anciennement « Découpeur de tokens ») est un outil qui compte les tokens d'un texte puis le découpe en chunks : des segments d'une taille fixe en tokens, avec un recouvrement (overlap) configurable entre deux segments consécutifs.
Les modèles d'IA (GPT, Claude, modèles d'embeddings…) ne lisent pas des mots mais des tokens, et leur fenêtre de contexte est limitée. Le chunking est donc indispensable pour préparer de longs contenus : alimenter une base RAG (retrieval-augmented generation), générer des embeddings, ou envoyer un document long à un LLM sans dépasser sa limite. Le recouvrement conserve du contexte entre les segments pour ne pas couper une idée en deux.
Collez votre texte, choisissez le modèle (le tokenizer correspondant est chargé automatiquement), la taille de chunk et l'overlap : l'outil affiche chaque chunk avec ses positions et son nombre de tokens, et vous pouvez tout exporter en JSON. Vous pouvez aussi comparer plusieurs tailles de chunk d'un coup.