Detectores de IA y sesgo contra estudiantes
Un puntaje de detección de IA no prueba una falta. Conoce sus sesgos lingüísticos y un protocolo de revisión justa para educación superior.
Un estudiante entrega un ensayo. El sistema lo marca como “probablemente generado por inteligencia artificial”. El porcentaje parece preciso, la interfaz usa colores convincentes y la sospecha comienza a adquirir apariencia de hecho. Pero el detector no observó cómo se investigó, qué borradores se descartaron ni quién tomó cada decisión. Solo comparó patrones del texto con aquellos que su modelo asocia a escritura humana o automatizada. Esa diferencia es decisiva. Una alerta de detección no demuestra autoría ni engaño. Puede orientar una revisión, pero convertirla directamente en acusación o sanción confunde una estimación estadística con una prueba. El riesgo aumenta cuando quien escribe utiliza el inglés —u otra lengua académica dominante— como idioma adicional, porque ciertos rasgos aprendidos con esfuerzo pueden parecerse a los que algunas herramientas consideran “típicos” de una máquina. La preocupación no obliga a abandonar la integridad académica. Obliga a practicarla también al investigar una posible falta: con evidencia suficiente, criterios transparentes, proporcionalidad y derecho a responder. Qué detecta realmente un detector Los detectores de escritura con IA no encuentran una huella digital universal de ChatGPT. Analizan regularidades como la previsibilidad de las palabras, la variación de las frases y otras características estadísticas. A partir de ellas asignan una clasificación o un puntaje. El problema es que esos rasgos no pertenecen exclusivamente a las máquinas. Una persona puede escribir de manera predecible porque está comenzando a dominar una lengua, porque prefiere estructuras sencillas, porque siguió una plantilla, porque el género académico exige fórmulas recurrentes o porque editó el texto para hacerlo más claro. A la inversa, un texto generado puede reescribirse, traducirse o modificarse hasta eludir una herramienta. Por eso existen dos errores distintos. Un falso positivo ocurre cuando escritura humana es clasificada como generada por IA. Un falso negativo , cuando contenido generado o transformado mediante IA pasa como humano. Una herramienta puede reducir uno y aumentar el otro. Ningún porcentaje elimina la necesidad de preguntar qué población, idioma, disciplina y tipo de tarea se utilizaron para validarla. La advertencia que surge de estudiantes no nativos en inglés En 2023, un equipo de Stanford examinó siete detectores ampliamente utilizados con 91 ensayos TOEFL escritos por personas no nativas en inglés y 88 ensayos de estudiantes estadounidenses de octavo grado. Según el estudio publicado en Patterns , los detectores clasificaron erróneamente como generados por IA más de la mitad de los textos TOEFL: la tasa media de falsos positivos fue de 61,3%. El dato se vuelve más inquietante al mirar la coincidencia entre herramientas. Todas marcaron erróneamente 19,8% de los ensayos TOEFL, mientras al menos una señaló 97,8%. El análisis vinculó el problema con una menor “perplejidad”: en términos simples, textos cuyas siguientes palabras resultan más fáciles de predecir para un modelo lingüístico. Quienes escribían en una segunda lengua tendían a utilizar un repertorio más acotado y estructuras menos variables, rasgos que los detectores podían interpretar como señal de automatización. La síntesis de Stanford HAI advierte sobre la consecuencia educativa: una tecnología presentada como neutral puede penalizar una diversidad lingüística que las instituciones deberían acompañar. Sin embargo, estas cifras requieren contexto. El estudio trabajó con textos en inglés, conjuntos específicos y detectores disponibles en 2023. No demuestra que todas las herramientas actuales tengan exactamente el mismo desempeño, ni permite trasladar el 61,3% al español, a Chile o a toda América Latina. Su enseñanza más sólida es otra: antes de usar un detector en decisiones de alto impacto, la institución debe comprobar cómo funciona con su propia población . El idioma no es la única fuente de variación La etiqueta “estudiante multilingüe” reúne experiencias muy distintas. No es igual una persona que cursó toda su escolaridad en otro idioma, alguien que pertenece a un pueblo originario, un estudiante migrante recién incorporado, una persona sorda que utiliza lengua de señas o quien desarrolla una trayectoria académica bilingüe desde la infancia. Tampoco todos escriben con el mismo apoyo, tiempo o seguridad. Una clasificación automatizada puede interactuar con esas diferencias de formas difíciles de anticipar. También puede afectar a estudiantes que usan tecnologías de apoyo, correctores gramaticales, traducción autorizada o acompañamiento de escritura. La pregunta no debería ser solo si una herramienta “detecta IA”, sino qué prácticas considera normales, con qué textos fue evaluada y a quién obliga a demostrar inocencia con mayor frecuencia. Aquí aparece un riesgo institucional: la carga desigual de la sospecha . Si ciertos estilos activan más alertas, sus autores enfrentarán más entrevistas, retrasos, estrés y posibles anotaciones, aun cuando finalmente no sean sancionados. El daño no se limita al veredicto. También incluye el proceso. Precisión aparente, evidencia insuficiente Otro estudio de 2023, publicado en el International Journal for Educational Integrity , evaluó 12 herramientas públicas y dos sistemas comerciales. Sus autores concluyeron que las soluciones examinadas no eran suficientemente precisas ni confiables para distinguir de manera consistente textos humanos y generados. Además, las técnicas de ofuscación empeoraban el desempeño. El hallazgo muestra una asimetría incómoda. Una persona que escribe honestamente puede ser marcada por usar lenguaje predecible, mientras alguien decidido a ocultar el uso de IA puede modificar la salida para reducir la probabilidad de detección. El control automático termina siendo más gravoso para quien no intenta evadirlo. Eso no significa que un indicador carezca de toda utilidad. Puede señalar un fragmento que conviene revisar o abrir una conversación pedagógica. Pero su valor depende del lugar que ocupa en el procedimiento. Un detector utilizado como semáforo para mirar con atención es distinto de un detector convertido en juez. Un protocolo mínimo antes de cualquier consecuencia Las instituciones de educación superior necesitan reglas comunes. No es razonable que cada docente decida en soledad cuánto confiar en un porcentaje ni que el resultado cambie según la asignatura. Un protocolo responsable debería incluir, al menos, ocho resguardos. 1. Definir previamente los usos permitidos La política del curso debe explicar si la IA puede utilizarse para buscar ideas, traducir, corregir, estructurar, programar, resumir o redactar, y qué usos deben declararse. No puede probarse una infracción sin una regla comprensible y comunicada antes de la evaluación. 2. Prohibir la sanción basada solo en el puntaje El resultado automatizado debe registrarse como señal no concluyente. No debería traducirse por sí mismo en nota, anulación, denuncia ni exigencia de confesión. Tampoco conviene presentar el porcentaje al estudiante como si expresara certeza sobre su conducta. 3. Preservar y revisar el contexto de la tarea Antes de entrevistar, corresponde revisar la consigna, los materiales autorizados, las instrucciones sobre colaboración, el tiempo disponible y la forma en que se enseñó el género solicitado. Una tarea formulaica puede producir textos formulaicos sin que exista engaño. 4. Considerar evidencia del proceso Borradores, notas, fuentes consultadas, comentarios de retroalimentación, historial de versiones cuando esté disponible y coherencia con trabajos anteriores pueden aportar contexto. Ningún elemento es infalible: no todas las personas guardan borradores ni escriben conectadas a una plataforma. Por eso deben valorarse en conjunto, no como nuevos requisitos automáticos. 5. Realizar una conversación pedagógica, no un interrogatorio La persona debería poder explicar su argumento, sus fuentes y sus decisiones de escritura. Una breve actividad complementaria puede ayudar, siempre que respete accesibilidad, dominio lingüístico, ansiedad y condiciones de discapacidad. Expresarse con dificultad en una entrevista no prueba que alguien no haya escrito su texto. 6. Incorporar una segunda revisión humana Si persiste una sospecha, otra persona con preparación en evaluación e integridad debería revisar los antecedentes sin depender ciegamente del primer juicio. Separar alerta, investigación y decisión reduce el riesgo de que la acusación inicial determine todo lo que se observa después. 7. Garantizar notificación y apelación El estudiante debe conocer qué se cuestiona, qué evidencia se utilizó y cómo puede responder. También necesita un canal de apelación ante una instancia distinta. El enfoque de UNESCO sobre IA generativa en educación e investigación refuerza la necesidad de gobernanza humana, protección de derechos y validación contextual, especialmente cuando la tecnología influye en decisiones relevantes. 8. Auditar la herramienta y la práctica institucional No basta con pedir una cifra global de precisión al proveedor. La institución debe evaluar falsos positivos y negativos por idioma, disciplina, extensión, nivel formativo y grupos pertinentes; documentar versiones del sistema; monitorear apelaciones; y suspender su uso si aparecen daños desproporcionados. Si no puede realizar esa validación, tampoco puede sostener que el puntaje es evidencia robusta. La alternativa no es volver a una vigilancia artesanal Renunciar al veredicto automático no significa pedir a docentes que adivinen quién usó IA por intuición. Esa práctica también puede estar atravesada por sesgos: cambios de estilo, vocabulario sofisticado o una mejora repentina pueden despertar sospechas sin fundamento. La respuesta más sostenible está antes de la detección. Diseñar evaluaciones con etapas, retroalimentación, decisiones situadas, fuentes verificables y oportunidades para explicar el proceso reduce la dependencia de una sola entrega. También permite enseñar el uso responsable de IA en vez de empujarlo a la clandestinidad. Conviene, además, separar tres preguntas que suelen mezclarse: ¿se utilizó una herramienta?, ¿ese uso estaba permitido? y ¿afectó la validez del aprendizaje evaluado? Un corrector, una traducción, una lluvia de ideas y la generación completa de una respuesta no son equivalentes. La política debe distinguirlos. La integridad también protege a quien es acusado Las instituciones suelen hablar de integridad para resguardar el valor de sus evaluaciones y títulos. Es correcto. Pero la integridad pierde coherencia cuando se investiga una posible falta mediante una herramienta opaca, sin validación local y sin oportunidad real de contradicción. El desafío no consiste en elegir entre ingenuidad tecnológica y tolerancia al fraude. Consiste en construir procedimientos capaces de investigar sin prejuzgar. Un detector puede sugerir dónde mirar; no puede saber quién escribió, qué ayuda recibió ni si esa ayuda infringió una regla. En una comunidad multilingüe, esa modestia no es debilidad. Es una condición de justicia. Si una institución exige evidencia para aprobar el trabajo de sus estudiantes, también debería exigir evidencia suficiente antes de castigarlos. Seguir aprendiendo a evaluar con tecnología sin delegar el juicio educativo también forma parte de la innovación académica. Regístrate gratis en InnovacionAcademica.org y participa en una comunidad interesada en fortalecer la enseñanza, la calidad y la confianza en la educación superior. Fuentes consultadas Liang, W., Yuksekgonul, M., Mao, Y., Wu, E. y Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns, 4(7), 100779. Europe PMC. Texto completo abierto de Liang et al. (2023). Weber-Wulff, D. et al. (2023). Testing of detection tools for AI-generated text. International Journal for Educational Integrity, 19, 26. Stanford Institute for Human-Centered Artificial Intelligence. (2023). AI-Detectors Biased Against Non-Native English Writers. UNESCO. (2023). Guidance for generative AI in education and research.