Naturalmelo Research · Estudio con datos originales

La brecha léxica de la IA: lo que 33.160 textos emparejados humano–IA revelan sobre cómo escribe realmente la IA

Medimos con qué frecuencia aparecen 14 frases famosas “de sonido IA” en escritura humana y de IA emparejada — 8.290 documentos por autor, ~16,5 millones de palabras. Algunos clichés de IA son hasta 205× más frecuentes en texto de GPT-4o. Otros, incluido el “señal de IA” más famoso de todos, resultaron ser mitos.

205×
más documentos de GPT-4o contienen "tapestry" que documentos humanos
26.1%
de los textos de GPT-4o contienen "tapestry" o "delve" — frente al 0.36% de los textos humanos
33,160
documentos emparejados de ~500 palabras analizados (≈16,5M de palabras)
2 / 14
“señales de IA” famosas que no pasaron la prueba — incluida "important to note"

01 — PanoramaHallazgos clave

19.8% vs 0.10%"Tapestry" es el marcador de IA individual más fuerte que medimos. Aparece en uno de cada cinco documentos de GPT-4o, pero en uno de cada mil documentos humanos emparejados — una brecha de 205× (p < 0.001).
1 de 4 vs 1 de 276La comprobación compuesta es aún más nítida. El 26.1% de los documentos de GPT-4o contienen "tapestry" o "delve"; en escritores humanos es el 0.36% — una brecha de 72×.
3 huellasLos modelos no comparten un solo estilo. GPT-4o abusa de tapestry / testament / underscores; GPT-4o mini lidera en not only… but also (23.4%); Llama 3 70B prefiere in conclusion (11.5% — más que GPT-4o).
0.04% vs 0.21%La “señal de IA” más famosa falló. "It's important to note" apareció menos a menudo en GPT-4o que en texto humano. "Worth noting" no mostró diferencia significativa en absoluto (p = 0.38).

Por qué importa: conectores clásicos como "furthermore" y "moreover" solo están 3–7× elevados en texto de IA, pero aparecen en ~2.5% de documentos genuinamente humanos — una razón por la que detectar IA con una sola frase genera acusaciones falsas. Una detección fiable necesita tasas base, y eso es lo que aporta este estudio.

02 — ContextoPor qué hicimos este estudio

Todo el mundo “sabe” que la escritura de IA está llena de delve, tapestry e it's important to note. Los docentes las subrayan; los hilos de Reddit las tratan como prueba de uso de ChatGPT; las herramientas de detección las marcan. Pero casi nadie ha publicado las tasas base: ¿con qué frecuencia aparecen estas frases en texto de IA — y, igual de importante, con qué frecuencia las usan también los humanos reales?

Ese segundo número decide si una frase es evidencia o una máquina de acusaciones falsas. Así que medimos ambas, usando el corpus paralelo HAP-E (Reinhart et al., Carnegie Mellon, 2024) — un conjunto raro en el que humanos y LLMs continúan exactamente los mismos textos, lo que hace la comparación justa entre prosa académica, noticias, ficción, blogs, transcripciones habladas y guiones de TV/cine.

03 — Los datos14 frases en 33.160 documentos emparejados

Cada celda muestra la proporción de documentos de ~500 palabras (n = 8.290 por autor) que contienen la frase al menos una vez — el sombreado es proporcional a la tasa. La coincidencia fue sin distinguir mayúsculas y cubrió variantes (p. ej., delve/delving/delves).

Tabla 1 — Proporción de documentos que contienen cada frase, por autorCorpus HAP-E · n = 8.290 documentos ≈ 4,1M de palabras por autor · ordenado por ratio GPT-4o ÷ Humano
PhraseHumanGPT-4oGPT-4o miniLlama 3 70BGPT-4o ÷ Human
tapestry0.10%19.8%20.9%1.5%205×
testament to0.10%16.1%8.4%5.4%167×
in conclusion0.07%7.2%5.4%11.5%100×
underscores / underscoring0.13%12.7%9.9%0.7%96×
vibrant0.17%12.1%16.8%2.3%72×
delve / delving0.27%8.1%8.7%2.9%31×
serves as a0.13%3.3%4.3%0.8%25×
crucial role0.08%2.1%1.7%2.2%24×
not only … but also1.30%15.4%23.4%1.5%12×
showcase / showcasing0.31%3.3%6.2%1.1%11×
moreover2.42%12.3%17.7%6.3%5.1×
furthermore2.48%8.6%11.4%12.6%3.5×
worth noting0.10%0.16%0.24%0.35%1.6× n.s.
important to note0.21%0.04%0.10%0.13%0.2×
Mayor proporción de documentos Menor proporción ≥30× marcador fuerte de IA n.s. / reverse no es evidencia fiable de IA

Todas las brechas excepto "worth noting" son estadísticamente significativas a p < 0.01 (chi-cuadrado, 2×2, con corrección de continuidad). Línea base humana = la continuación genuina del mismo texto fuente (HAP-E "chunk 2").

Figura 1 — Los seis marcadores más fuertes: GPT-4o vs humano, mismas tareas de escritura
Proporción de documentos que contienen la frase · barras escaladas al 21%
tapestry
GPT-4o19.8%
Human0.10%
testament to
GPT-4o16.1%
Human0.10%
underscores / underscoring
GPT-4o12.7%
Human0.13%
vibrant
GPT-4o12.1%
Human0.17%
in conclusion
GPT-4o7.2%
Human0.07%
delve / delving
GPT-4o8.1%
Human0.27%
GPT-4o (gpt-4o-2024-08-06)Humano (continuación emparejada)
26.1%
GPT-4o
documentos que contienen "tapestry" o "delve" — más de 1 de cada 4
72×
la brecha entre GPT-4o y escritores humanos en la misma comprobación de dos palabras — mismos temas, misma longitud, mismos géneros
0.36%
Escritores humanos
misma comprobación, mismas tareas de escritura — unos 1 de cada 276 documentos

04 — Comparación de modelosCada modelo tiene su propia huella

Una sola “lista de frases de IA” trata a todos los modelos como un mismo escritor. Los datos dicen lo contrario — cada modelo tiene un conjunto característico de hábitos:

GPT-4o

El modelo "tapestry" — abstracciones con sabor a imagen
tapestry19.8%
testament to16.1%
underscores12.7%

GPT-4o mini

Modelo más pequeño, clichés más fuertes — plantillas estructurales
not only … but also23.4%
tapestry20.9%
moreover17.7%

Llama 3 70B

Evita las “palabras de ChatGPT” — ama el andamiaje de ensayo
furthermore12.6%
in conclusion11.5%
tapestry1.5%
Implicación: un detector afinado solo al vocabulario de ChatGPT de la era 2023 se perderá la salida al estilo Llama, y viceversa. Una detección fiable de escritura IA tiene que puntuar muchas señales superpuestas — fraseo, ritmo, estructura — no una sola lista de palabras. Así es exactamente como el detector de IA de Naturalmelo aborda la detección a nivel de oración.

05 — Chequeo de mitosDos “señales de IA” famosas fallaron la prueba

Mito desmentido
"It's important to note…"

Quizá la frase de ChatGPT más citada en internet — y sin embargo GPT-4o la usó en solo 3 de 8.290 documentos (0.04%), cinco veces menos que los escritores humanos (0.21%).

No significativo
"Worth noting…"

No hubo diferencia estadísticamente significativa entre ningún modelo y los escritores humanos (p = 0.38). Subrayarla como evidencia de IA es especulación.

¿Por qué? Los hábitos de frase son específicos de cada versión. El ChatGPT temprano (GPT-3.5, 2023) matizaba constantemente en entornos de preguntas y respuestas, y el meme se quedó. Pero los modelos de generación 2024 que escriben prosa continua tienen otros hábitos — los clichés pasaron del hedging ("important to note") a la grandilocuencia ("a testament to", "a rich tapestry").

Advertencia para docentes y editores: "furthermore" y "moreover" aparecen en aproximadamente el 2.5% de documentos genuinamente humanos — entre las tasas base humanas más altas de cualquier frase que probamos. Subrayar un "furthermore" como evidencia de IA acusará erróneamente a escritores reales con mucha más frecuencia que los marcadores de 205×. Las frases sueltas son indicios probabilísticos, nunca una prueba — una lección coherente con las tasas de falsos positivos de ~20% que se reportan en la industria para detectores de IA.

06 — Caso de estudio"Tapestry" invade la ficción

La brecha es mayor donde la palabra menos pertenece. Al continuar ficción clásica — novelas y cuentos de dominio público:

29.1%

de las continuaciones de ficción de GPT-4o metieron la palabra "tapestry" (406 de 1.395) — frente al 0.5% de las continuaciones humanas reales (7 de 1.395). Una brecha de 58× dentro de un género donde la frase no aporta nada.

GPT-4o29.1%
Human0.5%
"The bustling scenes outside the window blurred past, a tapestry of colors and shapes, as adventures waited just beyond the horizon." — GPT-4o, al pedirle continuar una novela infantil de dominio público (HAP-E, doc fic_0012@gpt-4o-2024-08-06)

Esta es la firma del fraseo de plantilla: el modelo recurre a la misma abstracción decorativa sin importar el contexto. También es por eso que la revisión a nivel de oración supera una sola puntuación de documento — la marca debería apuntar a esa oración, no vagamente a toda la página.

07 — Conclusiones prácticasQué significa esto para estudiantes y escritores

Si usas IA para redactar o pulir: las frases de mayor riesgo no son las que has oído. Antes de entregar, busca en tu borrador tapestry, testament, underscores, vibrant, delve, showcase, not only… but also — cada una es 10–205× más común en texto de IA. Sustituirlas por un lenguaje concreto y específico elimina las señales de plantilla más fuertes.

Si escribes sin IA: es estadísticamente improbable que actives los marcadores fuertes (menos de 1 de cada 250 documentos humanos contienen "tapestry" o "delve"). Pero sí puedes usar "furthermore" o "moreover" — y un detector tosco basado en listas de frases puede marcarte de todos modos. Si eso pasa, el historial de versiones y los borradores siguen siendo tu mejor evidencia; consulta nuestra guía sobre cómo funcionan los detectores de IA.

Revisa tu propio borrador en 30 segundos

El detector de IA gratuito de Naturalmelo marca frases de plantilla oración por oración — incluidos los marcadores de este estudio — y reescribe las oraciones marcadas en un clic. Sin registro.

Haz una verificación de escritura IA gratis → O corrige el texto marcado directamente con el humanizador de IA

08 — MétodosMetodología

Corpus

Usamos el Human-AI Parallel Corpus (HAP-E), publicado por investigadores de Carnegie Mellon University (Reinhart, Brown, et al., 2024; arXiv:2410.16107). HAP-E toma 8.290 textos humanos auténticos de ~1.000 palabras en seis géneros (artículos académicos, noticias, ficción, blogs, transcripciones de podcasts, guiones de TV/cine), divide cada uno en dos fragmentos de ~500 palabras, da el primero a un LLM y le pide que escriba las siguientes ~500 palabras en el mismo estilo y tono. El segundo fragmento humano genuino sirve como línea base humana emparejada — mismo tema, mismo registro, misma longitud objetivo.

Autores comparados

Continuaciones humanas ("chunk 2"), GPT-4o (gpt-4o-2024-08-06), GPT-4o mini (2024-07-18) y Llama 3 70B Instruct — 8.290 documentos cada uno, 33.160 documentos y ≈16,5 millones de palabras en total. (HAP-E también incluye modelos base Llama, que excluimos porque no se despliegan como asistentes de escritura.)

Medición

Para cada uno de 14 patrones de frase contamos el número de documentos por autor que contienen el patrón al menos una vez (coincidencia de subcadena sin distinguir mayúsculas; los patrones por raíz capturan inflexiones, p. ej. delv- → delve/delves/delving). Los conteos se obtuvieron con consultas SQL documentadas (DuckDB) contra el corpus vía el servidor de datasets de Hugging Face el 2 de agosto de 2026, y son exactamente reproducibles. Se reporta la proporción de documentos que contienen la frase, no la frecuencia cruda de tokens, para que cada documento pese igual. Significancia: chi-cuadrado 2×2 con corrección de continuidad.

Limitaciones

  • La coincidencia por subcadena puede incluir usos raros fuera de objetivo (p. ej., "underscore" como nombre de personaje contaría); con n = 8.290 por grupo ese ruido es negligible frente a las brechas observadas.
  • El corpus normaliza la puntuación, así que las “señales” populares de puntuación (como la raya em dash) no pudieron probarse aquí.
  • Los modelos son de generación 2024; los modelos más nuevos desplazarán sus huellas — ese es uno de los puntos del estudio, y planeamos reejecuciones periódicas.
  • Solo inglés. Los inventarios de frases difieren por idioma.
  • La frecuencia de frases muestra cómo la IA tiende a escribir, no si un texto concreto fue escrito por IA. Ninguno de estos números por sí solo puede probar la autoría.

Datos y licencia

Los hallazgos y figuras de esta página se publican bajo CC BY 4.0 — reutiliza libremente con atribución a Naturalmelo Research y un enlace a esta página. Corpus subyacente © los autores de HAP-E (CC BY 4.0).

09 — PreguntasPreguntas frecuentes

¿Usar "delve" o "tapestry" prueba que un texto fue escrito por IA?

No. Estas frases son marcadores probabilísticos fuertes — "tapestry" es unas 205× más común en texto de GPT-4o que en texto humano emparejado — pero los humanos reales sí las usan (unos 1 de cada 1.000 documentos humanos en nuestros datos). Trátalas como señales para revisar una oración, nunca como prueba de autoría.

¿Es "it's important to note" una señal fiable de ChatGPT?

No para los modelos actuales. En nuestro análisis de 2026 de 8.290 documentos de GPT-4o, "important to note" apareció en solo el 0.04% — menos a menudo que en escritura humana emparejada (0.21%). La frase era un hábito del ChatGPT de la era 2023 en entornos de preguntas y respuestas; los modelos modernos que escriben prosa continua rara vez la usan.

¿Cuáles son las palabras marcadoras de IA más fuertes en 2026?

En este estudio: tapestry (205×), testament to (167×), in conclusion (100×), underscores (96×), vibrant (72×) y delve (31×), respecto a la escritura humana emparejada. La comprobación compuesta "contiene tapestry O delve" separa a GPT-4o de los humanos 26.1% vs 0.36%.

¿Todos los modelos de IA abusan de las mismas frases?

No. GPT-4o favorece tapestry/testament/underscores; GPT-4o mini lidera en not only… but also y vibrant; Llama 3 70B casi las evita, pero abusa de in conclusion y furthermore. Una detección basada en la lista de palabras de un solo modelo se perderá a los demás.

¿Pueden marcarme en falso por usar "furthermore" o "moreover"?

Es posible con una verificación tosca basada en frases — estos conectores aparecen en ~2.5% de documentos genuinamente humanos y solo están 3–7× elevados en texto de IA, las señales más débiles que medimos. Una buena detección pesa muchas señales por oración en lugar de fijarse en una sola palabra, y cualquier marca debería poder revisarse, no ser un veredicto automático.

¿Cómo puedo revisar mi propio borrador frente a estos marcadores?

El detector de IA gratuito de Naturalmelo escanea tu borrador oración por oración en busca de frases de plantilla (incluidos los patrones de este estudio), muestra por qué se marcó cada oración y puede reescribir las oraciones marcadas con el humanizador de IA integrado. Es gratis, sin registro, para borradores de 50–1.000 palabras.

10 — CitaCómo citar este estudio

Periodistas, docentes e investigadores pueden reutilizar estos hallazgos con atribución. Naturalmelo Research (2026). "The AI Vocabulary Gap: Phrase Frequency in 33,160 Matched Human and AI Texts." Naturalmelo. https://www.naturalmelo.com/research/ai-vocabulary-gap (data: HAP-E corpus, Reinhart et al. 2024, arXiv:2410.16107; analysis CC BY 4.0)

Lecturas relacionadas: Cómo funcionan los detectores de IA · Técnicas de humanización · Naturalmelo vs Turnitin