Estudiantes de la UNR escribieron preguntas para confundir a la IA y que conozca mejor América Latina
Alumnos de tres facultades de la Universidad Nacional de Rosario se sumaron el sábado 3 de octubre a un datathon regional que reunió a 188 estudiantes de 23 universidades de seis países. Tenían que armar preguntas sobre su cultura que los grandes modelos de lenguaje no supieran responder.
Alumnos de tres facultades de la Universidad Nacional de Rosario se sumaron el sábado 3 de octubre a un datathon regional que reunió a 188 estudiantes de 23 universidades de seis países. Tenían que armar preguntas sobre su cultura que los grandes modelos de lenguaje no supieran responder.
Un grupo de estudiantes de la Universidad Nacional de Rosario (UNR) participó en un datathon de inteligencia artificial: una maratón colectiva para armar datos, en este caso preguntas diseñadas para «engañar» a los grandes modelos de lenguaje, los sistemas que están detrás de los asistentes de IA. El objetivo era que esas herramientas aprendan más sobre América Latina. La UNR dio a conocer la actividad el martes 6 de octubre de 2026.
Un datathon para medir qué sabe la IA de América Latina
El evento se llamó «Datathon Regional: Evaluación sociocultural de los grandes modelos de lenguaje» y lo organizó Inria Chile, con el apoyo del Ministerio de Europa y Asuntos Exteriores de Francia, la red de Embajadas de Francia y las universidades latinoamericanas, que actuaron como operadores locales. En total participaron 188 estudiantes de 23 universidades de seis países de la región, según informó la UNR.
Desde Rosario participaron estudiantes de las licenciaturas en Relaciones Internacionales, Ciencia de Datos, Estadística y Comunicación Social, y de la tecnicatura en Inteligencia Artificial, que pertenecen a tres facultades: Ciencia Política y Relaciones Internacionales; Ciencias Exactas, Ingeniería y Agrimensura; y Ciencias Económicas y Estadística. La UNR no informó cuántos equipos de Rosario compitieron.
El problema: una IA entrenada en inglés y con datos del Norte
El punto de partida es que los grandes modelos de lenguaje no representan a todos los idiomas y culturas por igual. Según la UNR, estas tecnologías se usan masivamente en la región (en Chile las usa el 76% de la población adulta y Brasil es el tercer mercado mundial para OpenAI), pero los datos con los que se entrenan provienen sobre todo de países del Norte y están en inglés. Eso genera contenidos sesgados o vacíos de conocimiento cuando se aplican a contextos culturales del Sur. La competencia buscaba detectar esos sesgos culturales, lingüísticos, históricos, de género y de minorías.
Cómo se jugó el sábado 3 de octubre
Ese día, de 11 a 21, los participantes crearon preguntas pensadas para capturar conocimientos de su región, su país o su cultura. Cada una seguía el formato de opción múltiple: una respuesta correcta y tres «distractores» plausibles, escritos en español o portugués, más una versión obligatoria en inglés. Además, debían cargar datos obligatorios (país, región, dimensión cultural y una nota de contexto) y vincular cada pregunta a una página de Wikipedia; si no existía, tenían que justificar su origen cultural.
El reglamento descalificaba las entregas basadas en rumores o datos efímeros, opiniones, trivias sin valor sociocultural, errores factuales y contenidos que promovieran estereotipos dañinos o discriminatorios. Los equipos, de cuatro o cinco integrantes, tenían que ser interdisciplinarios: al menos una persona de exactas o ingeniería y otra de humanidades o ciencias sociales. Y los participantes se comprometieron a no usar inteligencia artificial generativa durante el desafío.
Quién decide si la IA se equivocó
La evaluación combinó un análisis de similitud de texto con revisión humana y después pasó a un panel formado por los propios modelos de lenguaje. El puntaje de cada equipo dependía de su capacidad para engañarlos dentro de las reglas, y un ranking se fue actualizando durante todo el evento. El equipo con el puntaje más alto de la región recibirá 2.000 euros, repartidos en partes iguales entre sus integrantes, y será reconocido en futuras publicaciones científicas vinculadas al dataset. La UNR no informó el resultado.
Qué es LatamQA
Todas las contribuciones originales de los estudiantes pasarán a integrar la próxima versión de LatamQA, un dataset abierto con licencia Creative Commons CC-BY-4.0. LatamQA es un conjunto de preguntas y respuestas para evaluar sesgos socioculturales en modelos de lenguaje con foco en América Latina. Su primera versión, descripta en un trabajo científico disponible en arXiv y presentado en un taller de la conferencia EACL en marzo de 2026, reúne más de 26.000 preguntas construidas a partir de Wikipedia, la estructura de Wikidata y conocimiento experto de las ciencias sociales. Entre sus hallazgos figura que los modelos rinden mejor en el idioma original de la pregunta y conocen mejor la cultura del español ibérico que la latinoamericana.
Como cierre, un video recapitulativo del datathon se difundirá en la sesión inaugural del IV Encuentro de Ciencia Abierta Francia – América Latina, que se hará en Montevideo, Uruguay, del 28 al 30 de octubre de 2026.
Fuente: Universidad Nacional de Rosario (nota del martes 6 de octubre de 2026) y trabajo «Leveraging Wikidata for Geographically Informed Sociocultural Bias Dataset Creation: Application to Latin America» (arXiv:2603.10001).
Más noticias de Inteligencia Artificial en MonoLito.
