35 ko de prompt chez soi : ce qui casse
Un praticien raconte l'échec puis le rattrapage d'une migration : des prompts d'agent de 35 ko, efficaces sur une API frontière, s'effondrent sur une installation Ollama locale. La cause n'est pas la taille du modèle mais la fenêtre de contexte — 65 000 tokens sur sa machine, dont 14 % consommés par le seul preprompt. Le billet donne une liste de signaux d'épuisement de contexte à surveiller dans les journaux, et une méthode de découpage en prompts à objectif unique.