Et ce n'est pas de la modestie : un tel détecteur ne peut pas être validé, et un qui se trompe est pire que rien parce qu'il donne confiance là où il n'y a pas lieu. Ce qu'on mesure ici, c'est le vide, une propriété du texte et non de son auteur — une personne peut écrire du remplissage et un modèle peut écrire quelque chose de substantiel. Et c'est en plus plus utile, car la vraie question de qui reçoit un document n'est pas « qui l'a écrit ? » mais « est-ce que ça vaut la peine de le lire en entier ? ».
content_cut
La méthode vient d'un dirigeant de Microsoft
Ryan Roslansky a raconté qu'il avait reçu un document fait avec une IA et que, plutôt que de le lire, il l'a passé à une autre IA pour qu'elle le résume : le résumé ne contenait pas une seule idée nouvelle. C'est une méthode, pas une impression, et elle est mesurée ici : on cherche l'ensemble minimal de paragraphes qui couvre tout ce que dit le texte, et ce qui reste, tu peux le jeter sans rien perdre. Le grand nombre, c'est ça.
psychology
Pourquoi il faut un modèle et pas une liste de mots
Les outils qui existent cherchent des mots : vocabulaire ampoulé, expressions toutes faites, bigrammes répétés. Cela attrape ce qui se répète littéralement. Mais le remplissage d'un modèle de langage répète la même idée avec d'autres mots, et là un dictionnaire ne suffit pas : dans la littérature du résumé automatique, les méthodes sémantiques détectent jusqu'à 90 % de la redondance contre 19 % pour les lexicales. C'est pourquoi on compare ici des sens et non des lettres — et pourquoi il faut télécharger une fois un modèle de 150 Mo.
tune
Le seuil EST ton taux de faux positifs
Monte-le et il ne marquera que les paragraphes qui sont presque des calques ; baisse-le et il se mettra à accuser de remplissage des paragraphes qui partagent un thème mais disent des choses différentes. Il n'y a pas de bonne valeur, il y a un compromis — le même que le seuil de confiance de la caméra dans Caméra avec IA locale. Un avertissement sur les chiffres : ce modèle comprime les similarités, n'attends donc pas 90 % entre deux paragraphes qui disent la même chose. Mesuré sur des textes de contrôle, les paraphrases éhontées tombent entre 62 et 69 % et les paragraphes aux faits différents sous 55 % ; c'est pourquoi la coupe est à 60. Bouge-le et regarde changer ce qui est barré avant de te fier à quoi que ce soit.
numbers
Un texte qui a de la substance apporte des données
« A baissé de 12 % en mars selon Nielsen » face à « a connu une évolution significative sur la période ». Pas besoin de comprendre le texte pour voir la différence : il suffit de compter les chiffres et noms propres pour 100 mots. C'est le signal le plus bête de tous et l'un des plus sûrs. Attention à un détail : le premier mot de chaque phrase ne compte PAS comme nom propre, car sa majuscule est de l'orthographe et non de l'information.
lock
Ton texte ne sort pas d'ici
Le modèle est téléchargé une fois —150 Mo, les mêmes que ceux déjà utilisés par les outils d'embeddings, de similarité et de RAG— et ensuite tout se passe dans ton navigateur. Cela compte plus qu'il n'y paraît : ce qu'on colle ici est en général un document interne que quelqu'un t'a envoyé, et ceux-là on ne les téléverse pas sur un serveur tiers pour qu'il les note.
compressCe texte dit-il quelque chose ?Combien on peut jeter sans perdre une seule idée
compress
Ce texte dit-il quelque chose ?Mesure combien on peut jeter sans perdre une seule idée
infoCeci ne dit pas si c'est une IA qui l'a écrit, et pas par modestie : un tel détecteur ne peut pas être validé, et un qui se trompe est pire que rien. Il mesure le vide, qui appartient au texte et non à son auteur — une personne peut écrire du remplissage et un modèle peut écrire quelque chose de substantiel. La question à laquelle il répond est « est-ce que ça vaut la peine de le lire en entier ? ».
cloud_download
Pour comparer des paragraphes par le sens, il faut un modèle d'IA multilingue d'environ 135 Mo, téléchargé une seule fois depuis Hugging Face et conservé dans ton navigateur. C'est le même que celui des outils d'embeddings, de similarité et de RAG : si tu en as déjà utilisé un, rien n'est téléchargé. Ton texte ne quitte pas l'appareil.