OpenAI lanza LifeSciBench para medir la capacidad real de la IA en investigación biológica

Última actualización: 22/06/2026
Autor: Isaac
  • LifeSciBench introduce 750 tareas complejas diseñadas por 173 científicos con doctorado para evaluar el razonamiento biológico real.
  • El modelo GPT-Rosalind se posiciona como el más avanzado con una tasa de aprobación del 36,1%, superando a versiones estándar como GPT-5.5.
  • La evaluación revela que la IA aún sufre dificultades significativas al procesar archivos complejos y artefactos externos como gráficos o secuencias genéticas.
  • El sistema utiliza más de 19.000 criterios de rúbrica para asegurar que las respuestas sean operativamente útiles y no solo teóricamente correctas.

IA analizando datos biológicos complejos

OpenAI ha puesto sobre la mesa LifeSciBench, una herramienta que busca separar el grano de la paja en lo que a inteligencia artificial aplicada a la biología se refiere. Hasta ahora, los exámenes para estos modelos parecían más un trivial de instituto que un reto para un investigador senior, pero esta nueva propuesta cambia las reglas del juego al centrarse en procesos reales de laboratorio, el diseño de experimentos y la toma de decisiones críticas bajo entornos de incertidumbre total.

No se trata simplemente de escupir datos sobre una proteína o un gen específico, sino de ver si estas máquinas son capaces de gestionar evidencia incompleta y reconciliar resultados que, a simple vista, resultan contradictorios. El proyecto ha contado con una supervisión de altura, involucrando a 173 científicos con doctorado que han volcado su experiencia en farmacología y biotecnología para asegurar que los resultados no sean solo ruido publicitario, sino una métrica fiable para la comunidad científica europea y global.

Un estándar de evaluación con sello de experto

La estructura de este benchmark es harina de otro costal si la comparamos con los métodos tradicionales como MMLU o MedQA. LifeSciBench se compone de 750 tareas de nivel experto que abarcan siete flujos de trabajo distintos, desde el manejo de evidencias hasta la comunicación científica pura y dura. Lo que realmente mola es que no son preguntas de opción múltiple; se plantean problemas abiertos donde el modelo debe interpretar figuras, tablas de datos y hasta archivos de estructura molecular para proponer una solución válida.

  ¿Qué es la evolución?

Para que nos hagamos una idea de la magnitud, se han establecido 19.020 criterios de rúbrica. Esto significa que una respuesta no es solo correcta o incorrecta por su conclusión final. Los expertos evalúan si el razonamiento es científicamente sólido y si se han tenido en cuenta las limitaciones críticas de un ensayo, algo vital cuando lo que está en juego es la salud de las personas o presupuestos millonarios en el desarrollo de fármacos.

Evaluación de modelos de lenguaje en ciencias de la vida

GPT-Rosalind lidera un podio todavía lejos de la perfección

En las pruebas realizadas con los modelos más punteros del mercado, GPT-Rosalind ha destacado por encima del resto, logrando una puntuación normalizada de 0,576. Aunque suena bien, la realidad es un poco más cruda: su tasa de aprobación se queda en un modesto 36,1%. Esto deja claro que, aunque la tecnología avanza a pasos agigantados, todavía le falta un hervor para poder sustituir el juicio clínico de un especialista humano en el día a día de una farmacéutica.

Otros modelos como Gemini 3.1 Pro o el propio GPT-5.5 han mostrado un rendimiento algo inferior, especialmente cuando la tarea requiere salir del modo texto y ponerse a analizar archivos adjuntos complejos. Se ha observado que la tasa de éxito cae en picado, pasando de un aceptable 44,5% en texto plano a un preocupante 28,6% cuando hay que lidiar con artefactos externos. Está claro que la precisión operativa en formatos especializados como las secuencias genómicas sigue siendo el talón de Aquiles de la IA actual.

Retos en la adopción y el futuro de la biotecnología

Uno de los puntos que más debate genera es el coste y la lentitud de estas evaluaciones. Al requerir una revisión humana tan exhaustiva para validar las rúbricas, no es algo que se pueda hacer de la noche a la mañana. Sin embargo, para las grandes empresas del sector en Europa, disponer de un baremo independiente y riguroso es fundamental para decidir qué tecnología integrar en sus procesos de descubrimiento de nuevos medicamentos sin correr riesgos innecesarios.

  IA aplicada a PlayStation: Ghost Player, podcasts y desarrollo

La gran incógnita que queda en el aire es si este sistema se convertirá en el estándar de la industria. Aunque OpenAI es el impulsor principal, la colaboración con científicos externos le da una pátina de credibilidad necesaria. Se espera que en los próximos meses, los laboratorios empiecen a usar estas métricas para cribar qué modelos de lenguaje son realmente capaces de realizar aportaciones valiosas en áreas como la inmunología o la química medicinal.

La llegada de este benchmark marca un antes y un después en la forma en que auditamos la inteligencia artificial aplicada a las ciencias biológicas. Los datos confirman que, si bien la IA es una aliada potente para sintetizar información y diseñar protocolos iniciales, todavía patina en la exactitud operativa que exige la investigación de vanguardia. La brecha entre una respuesta que parece correcta y una que es operativamente segura sigue siendo el gran desafío a batir para los desarrolladores de modelos en los años venideros.