Velocidad
Menos de la mitad del tiempo
2:35 por caso con Arkangel AI frente a 5:44 con búsqueda tradicional, una reducción cercana al 55%.
Historias de investigación
Asignamos al azar a estudiantes de medicina de años clínicos para resolver casos con o sin Arkangel AI, y especialistas ciegos calificaron cada respuesta. Los que tuvieron el asistente respondieron mejor, en menos de la mitad del tiempo y con la mitad de las búsquedas.
Imagina un examen a libro abierto contra el reloj, donde a la mitad de los estudiantes les toca, por sorteo, un asistente que no da la respuesta pero sí encuentra la fuente exacta, y unos jueces revisan cada respuesta sin saber quién tuvo ayuda. Eso hicimos con 83 estudiantes de cuatro universidades colombianas: resolvieron cuatro casos ambulatorios con dieciséis preguntas abiertas, unos con Arkangel AI y otros con la búsqueda de siempre. Dos especialistas ciegos por área, todos externos a la empresa, calificaron cada respuesta con seis criterios de validez clínica.
Los estudiantes con el asistente respondieron mejor en todos los criterios, en menos de la mitad del tiempo y con la mitad de las búsquedas. La aceptabilidad global fue 2.86 sobre 3.
Leer el artículo originalLa historia
Imagina un examen a libro abierto contra el reloj. Todos los estudiantes tienen delante los mismos casos y pueden buscar lo que quieran. La única diferencia es que a la mitad, por sorteo, le asignaron un asistente de investigación que no da la respuesta pero sí encuentra la fuente y le pasa la referencia exacta. La otra mitad busca como siempre: Google, PubMed, libros, guías o un colega. Al final, unos jueces revisan cada respuesta sin saber quién tuvo asistente.
Cada vez más estudiantes aprenden apoyados en inteligencia artificial, pero casi todas las evaluaciones de estas herramientas usan exámenes de opción múltiple, que se parecen poco a pensar un caso real. Un estudiante en la rotación no escoge entre cuatro opciones: busca, lee, interpreta y responde con sus propias palabras.
Invitamos a estudiantes de cuarto año o superior de cuatro universidades colombianas —Antioquia, los Andes, El Bosque y CES— y los asignamos al azar a dos grupos. El Grupo A resolvió los casos con Arkangel AI, un asistente que busca en fuentes científicas y muestra las referencias de cada respuesta. El Grupo B usó la ruta de siempre, sin ninguna herramienta de IA. En total participaron 83 estudiantes: 43 con asistente y 40 sin él.
La prueba era idéntica para todos: cuatro casos ambulatorios escritos por especialistas en ortopedia, psiquiatría, pediatría, y ginecología y obstetricia. Cada caso traía cuatro preguntas abiertas sobre diagnóstico, manejo, evidencia y conocimiento general. Todo se respondió en línea y cronometrado.
Dos especialistas por área, todos externos a Arkangel AI, calificaron cada respuesta sin saber a qué grupo pertenecía quien la escribió. Usaron seis criterios: exactitud, concordancia con guías, sesgo, vigencia, seguridad para el paciente y pertinencia clínica.
El experimento en cifras
La asignación fue aleatoria con Excel y tanto los investigadores como los evaluadores estuvieron ciegos a la identidad y al grupo de cada participante: un diseño doble ciego.
Qué encontramos
En la validez de las respuestas, el Grupo A superó al Grupo B en todos los criterios de la rúbrica, todos con p<0.001. La validez total promedio fue 2.73 sobre 3 con Arkangel AI frente a 2.55 con búsqueda tradicional. La mayor mejora relativa fue en exactitud de la respuesta: 12.76%.
La eficiencia también cambió. Con Arkangel AI, el tiempo mediano por caso fue 2 minutos y 35 segundos frente a 5 minutos y 44 segundos: cerca de 55% menos. Las búsquedas medianas bajaron de 6 a 3 por caso, cerca de 50% menos. Ambas diferencias tuvieron p<0.001.
La ventaja se sostuvo en cada especialidad y cada tipo de pregunta. La aceptabilidad global fue 2.86 de 3; la confianza en la veracidad obtuvo la nota más baja, 2.65, un escepticismo sano.
Velocidad
2:35 por caso con Arkangel AI frente a 5:44 con búsqueda tradicional, una reducción cercana al 55%.
Esfuerzo
3 búsquedas por caso frente a 6. Los estudiantes encontraron la fuente con menos pasos.
Consistencia
La ventaja se sostuvo por especialidad y tipo de pregunta; la mayor diferencia apareció en manejo y ginecología.
Aceptabilidad
La aceptabilidad global fue 2.86 de 3 y la confianza en la veracidad, 2.65.
Qué significa y qué no
El estudio dice algo concreto: en casos ambulatorios simulados, con asignación aleatoria y jueces ciegos, los estudiantes apoyados por un buscador clínico con fuentes trazables escribieron respuestas calificadas como más válidas y lo hicieron en menos de la mitad del tiempo y con la mitad de las búsquedas. Lo hicieron escribiendo respuestas abiertas, no resolviendo opción múltiple.
No prueba que la IA sirva para todo ni para todos. La muestra fue modesta y de pocas universidades colombianas; los casos fueron ficticios, ambulatorios y no urgentes. Los resultados reflejan razonamiento clínico académico, no decisiones críticas ni hospitalarias. Tampoco hubo un grupo sin búsqueda, y la escala de 3 puntos es poco sensible a matices.
El proyecto fue financiado por Arkangel AI y cuatro de los cinco autores están afiliados a la empresa. Para mitigar ese conflicto, hubo asignación aleatoria, diseño doble ciego, casos y evaluadores externos, revisión metodológica independiente y datos y scripts compartidos para reproducibilidad.
El mensaje no es que un asistente convierta a cualquiera en mejor médico. La pregunta relevante es si mejora cómo estudiantes reales buscan, leen y responden ante casos clínicos. Este estudio propone una forma de medirlo y deja abierta la validación con médicos graduados.
Paper
Estudio aleatorizado doble ciego con estudiantes de cuarto año o superior de cuatro universidades colombianas, asignados con Excel a búsqueda asistida por Arkangel AI (n=43) o búsqueda tradicional sin IA (n=40). Cada participante resolvió cuatro casos ambulatorios ficticios con cuatro preguntas abiertas. El diseño contemplaba hasta 1,328 respuestas sobre 332 unidades de caso. Hubo exclusiones documentadas por error de plataforma, uso de ChatGPT contra las instrucciones, una prueba incompleta y un cuestionario duplicado.
Dos especialistas ciegos y externos por área aplicaron seis ítems Likert de 3 puntos. La validez total promedio fue 2.73 (IC 95%: 2.71–2.76) en el Grupo A frente a 2.55 (IC 95%: 2.52–2.59) en el B, con p<0.001 en todos los dominios. El tiempo mediano fue 2:35 (IQR 2:01–3:46) frente a 5:44 (IQR 2:58–7:47), y las búsquedas medianas bajaron de 6 a 3; ambas p<0.001.
Las limitaciones incluyen muestra modesta, pocos centros, casos ficticios y ambulatorios, ausencia de control sin búsqueda, fuentes heterogéneas en el grupo tradicional, escala de 3 puntos, aceptabilidad medida solo en la intervención y afiliación de la mayoría de autores a Arkangel AI.