Etiqueta: datos biologicos

  • El fallo de la IA para descubrir farmacos

    El fallo de la IA para descubrir farmacos

    Los modelos de IA para descubrimiento de farmacos arrastran un problema que rara vez se admite en voz alta: se entrenan con datos que no reflejan la biologia humana real. La startup Vivodyne acaba de poner el dedo en la llaga al abrir lo que llama el mayor centro de datos humanos del mundo cerca de San Francisco. Su tesis es incomoda para buena parte del sector: si alimentas un modelo con datos de pruebas en animales o celulas aisladas, obtendras predicciones que fallan cuando llegan al paciente. La solucion que proponen es generar datos causales a partir de tejido vivo humano cultivado en laboratorio.

    Que ha pasado y por que importa

    Vivodyne ha inaugurado una instalacion que opera laboratorios roboticos llamados HIVE, capaces de cultivar 20 tipos de tejido humano distintos. El objetivo no es fabricar un farmaco concreto, sino producir a escala industrial los datos biologicos humanos que, segun la empresa, faltan en los modelos de IA actuales. La compania sostiene que la mayoria de estos modelos dependen de datos procedentes de ensayos con animales o de celulas individuales, ninguno de los cuales representa fielmente como responde un tejido humano vivo.

    Los datos que aporta la propia empresa son concretos: afirma que sus tejidos hepaticos alcanzan un 94% de precision predictiva frente a ensayos humanos en toxicidad, y que su capacidad de generacion de datos ya duplica el rendimiento de todos los ensayos con animales realizados en Estados Unidos. El planteamiento invierte la logica habitual del sector, que suele centrarse en algoritmos mas grandes. Vivodyne apunta al eslabon anterior: la calidad y la relevancia biologica de los datos de los que se aprende.

    El contexto ayuda a entender la apuesta. Durante decadas, el descubrimiento de farmacos ha usado modelos animales como paso previo a los ensayos clinicos, pese a su limitada capacidad para predecir la respuesta humana. La llegada de la IA prometia acelerar ese proceso, pero un modelo solo es tan bueno como los datos que lo alimentan. Si esos datos proceden de sistemas biologicos que no son humanos, el problema de fondo persiste.

    Implicaciones tecnicas de un cambio en la fuente de datos

    La aportacion tecnica clave de los datos biologicos humanos que defiende Vivodyne es la nocion de causalidad. No se trata solo de tener mas datos, sino datos que capturen como un compuesto afecta a tejido humano real, no correlaciones extraidas de sistemas sustitutos. Para los modelos de IA para descubrimiento de farmacos, esto podria significar predicciones de toxicidad y eficacia mas fiables antes de invertir en ensayos clinicos caros y largos.

    La escala robotica es el segundo elemento diferencial. Cultivar 20 tipos de tejido humano de forma reproducible y automatizada es lo que permite generar volumen suficiente para entrenar o afinar modelos. Un dato aislado de tejido humano tiene valor limitado; miles de puntos de datos consistentes y comparables cambian la ecuacion. El cuello de botella historico en biologia no ha sido la falta de algoritmos, sino la dificultad de producir datos humanos relevantes a gran escala.

    Conviene mantener el escepticismo sano. Las cifras de precision, como ese 94% en toxicidad hepatica, proceden de la propia empresa y aun no cuentan con validacion independiente amplia ni con un historial de farmacos aprobados que hayan seguido este camino de principio a fin. El salto entre un tejido cultivado y un organismo humano completo, con su sistema inmune, su metabolismo y sus interacciones entre organos, sigue siendo enorme. Los datos biologicos humanos mejoran la foto, pero no la completan.

    Cuando y para quien sera relevante esto

    El impacto de esta apuesta no se sentira de forma inmediata ni uniforme. Los primeros beneficiarios seran las farmaceuticas y las biotech que ya invierten en descubrimiento asistido por IA y que buscan reducir la altisima tasa de fracaso en fases clinicas. Para ellas, disponer de datos de tejido humano en las etapas preclinicas puede traducirse en descartar antes compuestos toxicos, algo con un valor economico directo. Ese segmento puede empezar a evaluar estos datos a corto plazo, pero la validacion real llegara solo cuando existan farmacos que hayan recorrido el ciclo completo apoyados en este enfoque, un proceso que se mide en anos.

    Para el ecosistema de IA mas amplio, la leccion es transversal y llega antes: la calidad y la representatividad de los datos de entrenamiento importan mas que el tamano del modelo. Las empresas que construyen IA vertical en cualquier dominio critico haran bien en preguntarse si sus datos reflejan de verdad el fenomeno que quieren predecir. Los datos biologicos humanos son un caso extremo de ese principio general. Para pacientes y sistemas sanitarios, el beneficio potencial (farmacos mas seguros y desarrollados mas rapido) es real pero lejano, y dependera de que las cifras prometidas resistan el escrutinio regulatorio y clinico.

    Analisis Blixel

    Durante anos hemos escuchado que la IA iba a acelerar la medicina, como si el algoritmo fuera la pieza que faltaba. La realidad es mas terca: un modelo entrenado con datos de raton predice, en el mejor de los casos, como responderia un raton. El merito de este planteamiento es que ataca el problema donde de verdad esta, en el sustrato biologico del que aprende la maquina, y no en la enesima arquitectura de red neuronal. Eso es honesto y poco habitual en un sector adicto a las metricas de computo.

    Dicho esto, toca aplicar el filtro que aplicamos a todo. Las cifras que maneja la empresa son suyas y estan por validar de forma independiente. Un 94% de precision en toxicidad hepatica suena excelente, pero el higado es solo un organo, y la toxicidad sistemica de un farmaco emerge de interacciones que un tejido aislado no reproduce. El riesgo aqui no es que la tecnologia no funcione, sino que se venda como una bala de plata cuando es, en realidad, una mejora incremental muy valiosa en una parte del pipeline. Para directivos que evaluan IA en dominios criticos, la moraleja es clara y aplicable fuera de la biotecnologia: antes de comprar el modelo mas potente del mercado, pregunta de que datos aprende y si esos datos se parecen a tu realidad. Esa pregunta, aburrida y poco glamurosa, decide mas proyectos que cualquier benchmark.

    Quieres aplicar esto en tu empresa? En Blixel.ai te ayudamos a integrar IA con sentido comun. Hablemos.