Texto y documentos
Números y cálculo
Datos y formatos
Seguridad
Desarrollo y DevOps
Inteligencia Artificial
Finanzas
Salud y bienestar
Productividad
Juegos y entretenimiento
Multimedia y diseño
Empresa
Guía de uso
Esto NO dice si lo escribió una IA

Y no es modestia: un detector así no se puede validar, y uno que se equivoca es peor que ninguno porque da confianza donde no la hay. Lo que se mide aquí es vacío, que es una propiedad del texto y no de su autor — una persona puede escribir relleno y un modelo puede escribir algo con sustancia. Y encima resulta más útil, porque la pregunta real de quien recibe un documento no es «¿quién lo escribió?» sino «¿me merece la pena leerlo entero?».

El método viene de un directivo de Microsoft

Ryan Roslansky contó que recibió un documento hecho con IA y, en vez de leérselo, se lo pasó a otra IA para que lo resumiera: el resumen no tenía ni una idea nueva. Eso es un método, no una impresión, y aquí está medido: se busca el conjunto mínimo de párrafos que cubre todo lo que dice el texto, y lo que sobra es lo que puedes tirar sin perder nada. El número grande es eso.

Por qué hace falta un modelo y no una lista de palabras

Las herramientas que ya existen buscan palabras: vocabulario cursi, frases hechas, bigramas repetidos. Eso caza lo que se repite literal. Pero el relleno de un modelo de lenguaje repite la misma idea con otras palabras, y ahí un diccionario no llega: en la literatura de resumen automático, los métodos semánticos detectan hasta el 90% de la redundancia frente al 19% de los léxicos. Por eso aquí se comparan significados, no letras — y por eso hace falta bajar un modelo de 150 MB una vez.

El umbral ES tu tasa de falsos positivos

Súbelo y solo marcará los párrafos que son casi calcos; bájalo y empezará a acusar de relleno a párrafos que comparten tema pero dicen cosas distintas. No hay un valor bueno, hay un compromiso — el mismo que el umbral de confianza de la cámara en Cámara con IA local. Un aviso sobre los números: este modelo comprime las similitudes, así que no esperes un 90% entre dos párrafos que dicen lo mismo. Midiéndolo con textos de control, las paráfrasis descaradas caen en el 62-69% y los párrafos con hechos distintos por debajo del 55%; por eso el corte está en 60. Muévelo y mira cambiar lo que se tacha antes de fiarte de nada.

Un texto con sustancia trae datos

«Bajó un 12% en marzo según Nielsen» frente a «experimentó una evolución significativa en el periodo». No hace falta entender el texto para ver la diferencia: basta contar cifras y nombres propios por cada 100 palabras. Es la señal más tonta de todas y de las más certeras. Ojo con un detalle: la primera palabra de cada frase NO cuenta como nombre propio, porque su mayúscula es ortografía y no información.

Tu texto no sale de aquí

El modelo se descarga una vez —son 150 MB, los mismos que ya usan las herramientas de embeddings, similitud y RAG— y a partir de ahí todo ocurre en tu navegador. Importa más de lo que parece: lo que se pega aquí suele ser un documento interno que alguien te ha mandado, y esos no se suben a un servidor ajeno para que los puntúe.

¿Este texto dice algo?Cuánto se puede tirar sin perder ninguna idea
¿Este texto dice algo?Mide cuánto se puede tirar sin perder ni una idea

Esto no dice si lo escribió una IA, y no por modestia: un detector así no se puede validar, y uno que se equivoca es peor que ninguno. Mide vacío, que es del texto y no de su autor — una persona puede escribir relleno y un modelo puede escribir algo con sustancia. La pregunta que responde es «¿me merece la pena leerlo entero?».

párrafos