El investigador Jochen Madler creó SlopShape, un sistema que busca detectar textos generados por inteligencia artificial y también aquellos que una persona apenas parafraseó desde una respuesta automática. Su hallazgo apunta a una huella menos visible: la arquitectura del discurso.

En pruebas con textos que el sistema no había visto, SlopShape alcanzó cerca de 98% de macro F1, una métrica que combina precisión y cobertura al clasificar contenidos humanos y artificiales. La oportunidad resulta especialmente relevante para escuelas, universidades y medios que necesitan revisar la procedencia de un texto.
El mecanismo no se limita a leer una frase y lanzar un veredicto. En cambio, utiliza un modelo de lenguaje para responder más de 200 preguntas sobre la estructura: dónde aparece la tesis, cómo se presentan las fuentes, si el texto promete sus propios apartados o si repite la misma conclusión al final.
La estructura como una instalación eléctrica
SlopShape observa el cableado de las ideas. No busca una palabra prohibida ni una fórmula aislada. Examina si el texto sigue una secuencia demasiado previsible: definición, ventajas, pasos, errores, recomendaciones y una conclusión que vuelve a explicar lo anunciado en la entrada.

Ese orden no demuestra, por sí solo, que haya intervenido una IA. Antes de ChatGPT, muchas agencias de comunicación ya publicaban textos corporativos con esa organización. La pieza clave es la combinación repetida de señales: explicaciones extensas sin avance real, datos sin contexto, afirmaciones sin fuente y listas equilibradas que parecen completas, pero aportan poco.
Para poner a prueba el sistema, Madler reunió 2.250 entradas de blogs de 268 empresas de comunicación. Todas eran anteriores al lanzamiento de ChatGPT y fueron recuperadas a través de Wayback Machine, una biblioteca digital de páginas archivadas.
Luego pidió a cinco modelos —GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 y Kimi K2.5— que escribieran versiones nuevas a partir de resúmenes de esos textos. El experimento produjo 11.250 piezas, incluidas reescrituras profundas y cambios menores.
El rendimiento se mantuvo entre 97 y 98 puntos de macro F1 incluso después de varias reescrituras con IA. Sin embargo, bajó hasta 88,1 cuando se modificaban los rasgos de estilo. Además, el sistema pudo reconocer qué modelo había producido un texto en el 79% de los casos, gracias a los “dejes” propios de cada herramienta.

Hay límites importantes. La investigación solo analizó artículos en inglés, por lo que sus resultados no se pueden trasladar de forma directa al español ni a cualquier contenido de internet. El propio artículo fue analizado por la herramienta como 70% humano, mientras que una entrevista alcanzó 80%.
Eso revela que el detector todavía necesita ajustes. Pero su enfoque abre una puerta útil: en lugar de perseguir palabras sospechosas, puede ayudar a mirar el engranaje completo de un texto. En una red llena de respuestas instantáneas, recuperar una idea que avanza de verdad puede ser el interruptor más humano de todos.

Directora de operaciones en GptZone. IT, especializada en inteligencia artificial. Me apasiona el desarrollo de soluciones tecnológicas y disfruto compartiendo mi conocimiento a través de contenido educativo. Desde GptZone, mi enfoque está en ayudar a empresas y profesionales a integrar la IA en sus procesos de forma accesible y práctica, siempre buscando simplificar lo complejo para que cualquiera pueda aprovechar el potencial de la tecnología.







