La brecha léxica de la IA: lo que 33.160 textos emparejados humano–IA revelan sobre cómo escribe realmente la IA
Medimos con qué frecuencia aparecen 14 frases famosas “de sonido IA” en escritura humana y de IA emparejada — 8.290 documentos por autor, ~16,5 millones de palabras. Algunos clichés de IA son hasta 205× más frecuentes en texto de GPT-4o. Otros, incluido el “señal de IA” más famoso de todos, resultaron ser mitos.
01 — PanoramaHallazgos clave
Por qué importa: conectores clásicos como "furthermore" y "moreover" solo están 3–7× elevados en texto de IA, pero aparecen en ~2.5% de documentos genuinamente humanos — una razón por la que detectar IA con una sola frase genera acusaciones falsas. Una detección fiable necesita tasas base, y eso es lo que aporta este estudio.
02 — ContextoPor qué hicimos este estudio
Todo el mundo “sabe” que la escritura de IA está llena de delve, tapestry e it's important to note. Los docentes las subrayan; los hilos de Reddit las tratan como prueba de uso de ChatGPT; las herramientas de detección las marcan. Pero casi nadie ha publicado las tasas base: ¿con qué frecuencia aparecen estas frases en texto de IA — y, igual de importante, con qué frecuencia las usan también los humanos reales?
Ese segundo número decide si una frase es evidencia o una máquina de acusaciones falsas. Así que medimos ambas, usando el corpus paralelo HAP-E (Reinhart et al., Carnegie Mellon, 2024) — un conjunto raro en el que humanos y LLMs continúan exactamente los mismos textos, lo que hace la comparación justa entre prosa académica, noticias, ficción, blogs, transcripciones habladas y guiones de TV/cine.
03 — Los datos14 frases en 33.160 documentos emparejados
Cada celda muestra la proporción de documentos de ~500 palabras (n = 8.290 por autor) que contienen la frase al menos una vez — el sombreado es proporcional a la tasa. La coincidencia fue sin distinguir mayúsculas y cubrió variantes (p. ej., delve/delving/delves).
| Phrase | Human | GPT-4o | GPT-4o mini | Llama 3 70B | GPT-4o ÷ Human |
|---|---|---|---|---|---|
| tapestry | 0.10% | 19.8% | 20.9% | 1.5% | 205× |
| testament to | 0.10% | 16.1% | 8.4% | 5.4% | 167× |
| in conclusion | 0.07% | 7.2% | 5.4% | 11.5% | 100× |
| underscores / underscoring | 0.13% | 12.7% | 9.9% | 0.7% | 96× |
| vibrant | 0.17% | 12.1% | 16.8% | 2.3% | 72× |
| delve / delving | 0.27% | 8.1% | 8.7% | 2.9% | 31× |
| serves as a | 0.13% | 3.3% | 4.3% | 0.8% | 25× |
| crucial role | 0.08% | 2.1% | 1.7% | 2.2% | 24× |
| not only … but also | 1.30% | 15.4% | 23.4% | 1.5% | 12× |
| showcase / showcasing | 0.31% | 3.3% | 6.2% | 1.1% | 11× |
| moreover | 2.42% | 12.3% | 17.7% | 6.3% | 5.1× |
| furthermore | 2.48% | 8.6% | 11.4% | 12.6% | 3.5× |
| worth noting | 0.10% | 0.16% | 0.24% | 0.35% | 1.6× n.s. |
| important to note | 0.21% | 0.04% | 0.10% | 0.13% | 0.2× |
Todas las brechas excepto "worth noting" son estadísticamente significativas a p < 0.01 (chi-cuadrado, 2×2, con corrección de continuidad). Línea base humana = la continuación genuina del mismo texto fuente (HAP-E "chunk 2").
04 — Comparación de modelosCada modelo tiene su propia huella
Una sola “lista de frases de IA” trata a todos los modelos como un mismo escritor. Los datos dicen lo contrario — cada modelo tiene un conjunto característico de hábitos:
GPT-4o
GPT-4o mini
Llama 3 70B
05 — Chequeo de mitosDos “señales de IA” famosas fallaron la prueba
Quizá la frase de ChatGPT más citada en internet — y sin embargo GPT-4o la usó en solo 3 de 8.290 documentos (0.04%), cinco veces menos que los escritores humanos (0.21%).
No hubo diferencia estadísticamente significativa entre ningún modelo y los escritores humanos (p = 0.38). Subrayarla como evidencia de IA es especulación.
¿Por qué? Los hábitos de frase son específicos de cada versión. El ChatGPT temprano (GPT-3.5, 2023) matizaba constantemente en entornos de preguntas y respuestas, y el meme se quedó. Pero los modelos de generación 2024 que escriben prosa continua tienen otros hábitos — los clichés pasaron del hedging ("important to note") a la grandilocuencia ("a testament to", "a rich tapestry").
06 — Caso de estudio"Tapestry" invade la ficción
La brecha es mayor donde la palabra menos pertenece. Al continuar ficción clásica — novelas y cuentos de dominio público:
de las continuaciones de ficción de GPT-4o metieron la palabra "tapestry" (406 de 1.395) — frente al 0.5% de las continuaciones humanas reales (7 de 1.395). Una brecha de 58× dentro de un género donde la frase no aporta nada.
"The bustling scenes outside the window blurred past, a tapestry of colors and shapes, as adventures waited just beyond the horizon." — GPT-4o, al pedirle continuar una novela infantil de dominio público (HAP-E, doc fic_0012@gpt-4o-2024-08-06)
Esta es la firma del fraseo de plantilla: el modelo recurre a la misma abstracción decorativa sin importar el contexto. También es por eso que la revisión a nivel de oración supera una sola puntuación de documento — la marca debería apuntar a esa oración, no vagamente a toda la página.
07 — Conclusiones prácticasQué significa esto para estudiantes y escritores
Si usas IA para redactar o pulir: las frases de mayor riesgo no son las que has oído. Antes de entregar, busca en tu borrador tapestry, testament, underscores, vibrant, delve, showcase, not only… but also — cada una es 10–205× más común en texto de IA. Sustituirlas por un lenguaje concreto y específico elimina las señales de plantilla más fuertes.
Si escribes sin IA: es estadísticamente improbable que actives los marcadores fuertes (menos de 1 de cada 250 documentos humanos contienen "tapestry" o "delve"). Pero sí puedes usar "furthermore" o "moreover" — y un detector tosco basado en listas de frases puede marcarte de todos modos. Si eso pasa, el historial de versiones y los borradores siguen siendo tu mejor evidencia; consulta nuestra guía sobre cómo funcionan los detectores de IA.
Revisa tu propio borrador en 30 segundos
El detector de IA gratuito de Naturalmelo marca frases de plantilla oración por oración — incluidos los marcadores de este estudio — y reescribe las oraciones marcadas en un clic. Sin registro.
Haz una verificación de escritura IA gratis → O corrige el texto marcado directamente con el humanizador de IA08 — MétodosMetodología
Corpus
Usamos el Human-AI Parallel Corpus (HAP-E), publicado por investigadores de Carnegie Mellon University (Reinhart, Brown, et al., 2024; arXiv:2410.16107). HAP-E toma 8.290 textos humanos auténticos de ~1.000 palabras en seis géneros (artículos académicos, noticias, ficción, blogs, transcripciones de podcasts, guiones de TV/cine), divide cada uno en dos fragmentos de ~500 palabras, da el primero a un LLM y le pide que escriba las siguientes ~500 palabras en el mismo estilo y tono. El segundo fragmento humano genuino sirve como línea base humana emparejada — mismo tema, mismo registro, misma longitud objetivo.
Autores comparados
Continuaciones humanas ("chunk 2"), GPT-4o (gpt-4o-2024-08-06), GPT-4o mini (2024-07-18) y Llama 3 70B Instruct — 8.290 documentos cada uno, 33.160 documentos y ≈16,5 millones de palabras en total. (HAP-E también incluye modelos base Llama, que excluimos porque no se despliegan como asistentes de escritura.)
Medición
Para cada uno de 14 patrones de frase contamos el número de documentos por autor que contienen el patrón al menos una vez (coincidencia de subcadena sin distinguir mayúsculas; los patrones por raíz capturan inflexiones, p. ej. delv- → delve/delves/delving). Los conteos se obtuvieron con consultas SQL documentadas (DuckDB) contra el corpus vía el servidor de datasets de Hugging Face el 2 de agosto de 2026, y son exactamente reproducibles. Se reporta la proporción de documentos que contienen la frase, no la frecuencia cruda de tokens, para que cada documento pese igual. Significancia: chi-cuadrado 2×2 con corrección de continuidad.
Limitaciones
- La coincidencia por subcadena puede incluir usos raros fuera de objetivo (p. ej., "underscore" como nombre de personaje contaría); con n = 8.290 por grupo ese ruido es negligible frente a las brechas observadas.
- El corpus normaliza la puntuación, así que las “señales” populares de puntuación (como la raya em dash) no pudieron probarse aquí.
- Los modelos son de generación 2024; los modelos más nuevos desplazarán sus huellas — ese es uno de los puntos del estudio, y planeamos reejecuciones periódicas.
- Solo inglés. Los inventarios de frases difieren por idioma.
- La frecuencia de frases muestra cómo la IA tiende a escribir, no si un texto concreto fue escrito por IA. Ninguno de estos números por sí solo puede probar la autoría.
Datos y licencia
Los hallazgos y figuras de esta página se publican bajo CC BY 4.0 — reutiliza libremente con atribución a Naturalmelo Research y un enlace a esta página. Corpus subyacente © los autores de HAP-E (CC BY 4.0).
09 — PreguntasPreguntas frecuentes
¿Usar "delve" o "tapestry" prueba que un texto fue escrito por IA?
No. Estas frases son marcadores probabilísticos fuertes — "tapestry" es unas 205× más común en texto de GPT-4o que en texto humano emparejado — pero los humanos reales sí las usan (unos 1 de cada 1.000 documentos humanos en nuestros datos). Trátalas como señales para revisar una oración, nunca como prueba de autoría.
¿Es "it's important to note" una señal fiable de ChatGPT?
No para los modelos actuales. En nuestro análisis de 2026 de 8.290 documentos de GPT-4o, "important to note" apareció en solo el 0.04% — menos a menudo que en escritura humana emparejada (0.21%). La frase era un hábito del ChatGPT de la era 2023 en entornos de preguntas y respuestas; los modelos modernos que escriben prosa continua rara vez la usan.
¿Cuáles son las palabras marcadoras de IA más fuertes en 2026?
En este estudio: tapestry (205×), testament to (167×), in conclusion (100×), underscores (96×), vibrant (72×) y delve (31×), respecto a la escritura humana emparejada. La comprobación compuesta "contiene tapestry O delve" separa a GPT-4o de los humanos 26.1% vs 0.36%.
¿Todos los modelos de IA abusan de las mismas frases?
No. GPT-4o favorece tapestry/testament/underscores; GPT-4o mini lidera en not only… but also y vibrant; Llama 3 70B casi las evita, pero abusa de in conclusion y furthermore. Una detección basada en la lista de palabras de un solo modelo se perderá a los demás.
¿Pueden marcarme en falso por usar "furthermore" o "moreover"?
Es posible con una verificación tosca basada en frases — estos conectores aparecen en ~2.5% de documentos genuinamente humanos y solo están 3–7× elevados en texto de IA, las señales más débiles que medimos. Una buena detección pesa muchas señales por oración en lugar de fijarse en una sola palabra, y cualquier marca debería poder revisarse, no ser un veredicto automático.
¿Cómo puedo revisar mi propio borrador frente a estos marcadores?
El detector de IA gratuito de Naturalmelo escanea tu borrador oración por oración en busca de frases de plantilla (incluidos los patrones de este estudio), muestra por qué se marcó cada oración y puede reescribir las oraciones marcadas con el humanizador de IA integrado. Es gratis, sin registro, para borradores de 50–1.000 palabras.
10 — CitaCómo citar este estudio
Naturalmelo Research (2026). "The AI Vocabulary Gap: Phrase Frequency in 33,160 Matched Human and AI Texts." Naturalmelo. https://www.naturalmelo.com/research/ai-vocabulary-gap (data: HAP-E corpus, Reinhart et al. 2024, arXiv:2410.16107; analysis CC BY 4.0)
Lecturas relacionadas: Cómo funcionan los detectores de IA · Técnicas de humanización · Naturalmelo vs Turnitin