Guía visual · sustentación

Todo lo que hicimos,
explicado por partes

Una simulación de proteínas corrida en una tarjeta gráfica de videojuegos. Aquí está cada pieza del proyecto convertida en algo que puedes mover, mirar y entender antes de explicárselo al jurado.

US$300
la tarjeta con la que se corrió todo
450 ns
de movimiento simulado en Chignolin
114 856
átomos en el sistema de la PTR1
0
eventos de desplegamiento vistos

Cada número de esta página sale del artículo entregado a la JIC. Nada está redondeado hacia arriba ni inventado para que suene mejor.

01 · Biología

Una proteína es un collar que se dobla solo

Toda proteína nace como una cadena estirada de piezas llamadas aminoácidos. En cuestión de microsegundos esa cadena se dobla sola, sin que nadie la ayude, hasta una forma tridimensional exacta. Y esa forma es la que decide qué sabe hacer.

Chignolin, la proteína más pequeña del proyecto

Diez esferas, diez aminoácidos. Cuando la cadena se dobla, los extremos se juntan y forman una horquilla. Es un esquema, no la geometría exacta de la molécula.

La regla de oro

Forma = función

Una proteína hace lo que hace por la forma que toma. Cambia la forma y cambia el trabajo, o deja de servir. Por eso conocer la forma es conocer la proteína.

Por qué importa

Si se pliega mal, hay problema

Varias enfermedades aparecen cuando una proteína se dobla mal. Entender el plegamiento es entender cómo se llega a la forma correcta y qué pasa cuando no se llega.

Cómo lo dices en la defensa Una proteína es un collar de piezas que se dobla solo hasta una forma exacta, y esa forma es la que decide su función. Chignolin tiene apenas diez piezas, por eso cabe en una simulación corta.
02 · La idea del proyecto

AlphaFold da la foto. La dinámica molecular da la película

Esta es la idea que sostiene todo el trabajo. AlphaFold, la inteligencia artificial que ganó el Nobel, predice la forma final de una proteína. Pero una foto no te dice cómo se llegó ahí ni cuánto tardó. Para eso hay que simular el movimiento átomo por átomo.

La misma proteína, dos maneras de mirarla

AlphaFold · predicción

La foto

Una sola imagen fija de la forma más probable. Es rapidísima y muy buena, pero está congelada: no dice cómo ni cuándo se dobló.

Dinámica molecular · simulación

La película

Miles de fotogramas seguidos. Con muestreo suficiente llega a los pasos intermedios y a la velocidad del plegado. Este trabajo no alcanzó esa parte.

La respuesta a «¿AlphaFold no resolvió ya todo esto?» AlphaFold resolvió predecir la forma final, y lo hace muy bien. No resolvió el movimiento. Una proteína no es una estatua: se dobla, respira, abre y cierra huecos, y ese movimiento es parte de su función. Las dos herramientas no compiten, se complementan: una dice cómo es la proteína, la otra cómo llega a serlo.
03 · La pieza clave

La regla del tiempo

Si entiendes esta sola imagen, entiendes el resultado principal del proyecto. Mueve el control y mira dónde cae cada cosa. Cada marca de la regla es diez veces más grande que la anterior.

De un paso de cálculo a un parpadeo

arrastra el control

Desliza la regla de lado con el dedo: sigue hasta el segundo.

15 ns
Lo que dura una sola de nuestras trayectorias.
Lo que sí alcanzamos

450 ns

Todo el movimiento simulado de Chignolin, sumando las 30 trayectorias.

Lo que hacía falta

0.6 µs

El tiempo que tarda Chignolin en plegarse según la literatura. Unas 40 veces más que cada una de nuestras ventanas de 15 ns.

Lo que cuesta

~140 ns/día

El rendimiento medido en la tarjeta con el sistema de la PTR1. Un microsegundo se lleva del orden de una semana de cálculo continuo.

Esta es la respuesta honesta del proyecto Cada trayectoria duró 15 nanosegundos y el evento que queríamos ver tarda unas 40 veces más. Es como grabar 40 veces un partido de fútbol, pero solo los primeros dos minutos de cada uno: por más veces que grabes, nunca vas a ver un gol del segundo tiempo. Por eso no medimos la velocidad de plegamiento, y por eso el siguiente paso es rediseñar el muestreo, no comprar una tarjeta más grande.
04 · El motor

Qué hace exactamente la tarjeta gráfica

En cada paso de la simulación hay que calcular la fuerza que siente cada átomo por culpa de todos los demás. Con 114 856 átomos eso son millones de cuentas, y hay que repetirlas millones de veces. La gracia de la tarjeta gráfica es que hace muchísimas cuentas a la vez.

Mismo trabajo, dos maneras de repartirlo

Analogía, no una medición. Lo real es que la simulación se hizo en la tarjeta gráfica porque este tipo de cálculo se reparte bien entre muchos núcleos pequeños trabajando a la vez.

El rol de la tarjeta

Resuelve la física

Conoce las fuerzas entre átomos y calcula hacia dónde se mueve cada uno. Repite ese cálculo cada 4 femtosegundos, millones de veces seguidas. Eso es la dinámica molecular.

El rol del procesador

Organiza y guarda

Prepara el sistema, lanza cada trayectoria, guarda un fotograma cada cierto tiempo y hace los análisis después. El trabajo pesado y repetitivo va a la tarjeta.

05 · La decisión

¿Por qué una sola tarjeta y no varias?

Es la pregunta más probable del jurado, y tiene una respuesta corta: porque esa era la pregunta del proyecto, no una limitación que estemos tapando.

Razón 1

Era la pregunta

El trabajo mide hasta dónde llega la simulación con recursos que un grupo estudiantil sí puede tener. Si usábamos un clúster, el resultado no contestaba esa pregunta.

Razón 2

Para que otros lo repitan

Un laboratorio pequeño de la región puede conseguir una tarjeta de US$300. Un resultado obtenido así se puede repetir en muchos más lugares.

Razón 3

Más tarjetas, solas, no bastaban

Con más máquinas se acumula más tiempo simulado, y eso ayuda. Pero el sesgo de arrancar todas las trayectorias desde la proteína ya plegada no se corrige multiplicando corridas iguales: hay que cambiar de dónde parten.

Pruébalo: ¿y si hubiéramos tenido más tarjetas?

mueve el control
1 tarjeta
30 trayectorias
450 ns acumulados
0.45 µs agregados

Cuenta orientativa, no un dato del trabajo. Toma como referencia el tiempo característico de plegado de Chignolin (0.6 µs) y supone que las transiciones ocurren al azar. El evento que aquí no se vio es el contrario, el desplegamiento; a 340 K los dos tiempos son del mismo orden, pero no son el mismo número.

Si te preguntan por IBEROGUN, el clúster de la universidad Se responde sin ponerse a la defensiva: el clúster existe y es una opción real para el siguiente paso. No era el punto de este trabajo. Reproducir la forma salió con hardware modesto, y medir el plegamiento pide otro diseño de muestreo. Con más máquinas se acumula más tiempo simulado, pero primero hay que cambiar de dónde arrancan las trayectorias.
06 · El método

El paso a paso, sin misterio

Cuatro etapas. Cada una vive en un script numerado del repositorio, así que cualquiera puede repetir la corrida completa.

La metemos en agua con sal

07 · La estrategia

Muestreo ramificado: 30 corridas cortas en vez de una larga

En lugar de dejar corriendo una sola simulación larguísima, se lanzaron muchas cortas e independientes. La idea viene de Folding@home, el proyecto que reparte simulaciones entre cientos de miles de computadoras del mundo. Aquí todo corrió en una sola tarjeta.

Tres rondas, diez trayectorias cada una

Ronda 1: diez trayectorias desde el sistema equilibrado. Rondas 2 y 3: diez más cada una, arrancando desde los estados finales de la ronda anterior. En total 30 trayectorias de 15 ns que suman 450 ns.

Qué gana este diseño

Se reparte y se reanuda

Si una corrida falla o se apaga la máquina, se pierde solo esa. Y se puede repartir entre varias computadoras sin cambiar nada del método.

Lo que hay que aclarar

No es muestreo adaptativo

Un muestreo adaptativo de verdad agrupa lo ya visto y decide desde dónde seguir para explorar lo que falta. El nuestro reparte por turnos entre los estados finales, sin esa decisión. Es honesto decirlo así.

Nunca digas esto No digas que montaron un "mini Folding@home". Folding@home solo inspiró la idea de usar muchos trabajos cortos. Las corridas fueron locales, con OpenMM, en una sola tarjeta.
08 · El resultado

Qué significa 0.85 Å

El ángström es la unidad con la que se miden los átomos. Un átomo de carbono mide alrededor de 1.7 Å de radio. O sea que las diferencias de las que hablamos son más chicas que un solo átomo.

Cuánto se separan dos estructuras

mueve el control o toca una marca

Las tres estructuras de verdad, en 3D

arrástrala para girarla

Esto no es un dibujo: son las coordenadas reales de los diez carbonos alfa de cada estructura, leídas de los archivos del proyecto y superpuestas con el mismo método del artículo. Por eso al medirlas aquí dan 0.90 Å para AlphaFold2 y 0.85 Å para la simulación, los mismos números de la lámina. Gírala y vas a ver que las tres van casi por el mismo camino, y que donde más se separan es en los extremos de la cadena.

Tres estructuras de Chignolin superpuestas: la experimental, la de AlphaFold2 y la representativa de la simulación
La figura real del artículo. Las tres estructuras de Chignolin superpuestas: la experimental, la predicción de AlphaFold2 y la estructura representativa de la simulación. Coinciden en lo esencial y se separan un poco en algunas cadenas laterales, que son las partes que se mueven con más libertad.
La trampa que tienes que desarmar antes de que te la pongan Parece que 0.85 Å le gana a los 0.90 Å de AlphaFold. No es una carrera y no se compara así. AlphaFold predijo a ciegas, solo con la secuencia. Nuestra simulación arrancó desde la estructura experimental, así que su 0.85 Å mide que la conservó, no que la haya adivinado. Son dos cosas distintas medidas con la misma regla.
Y la otra trampa En el conjunto de 22 500 fotogramas hubo uno que llegó a 0.15 Å. Ese número no se usa y hay que saber por qué: es el mejor de miles, y mientras más fotogramas guardes, más chiquito te va a salir. No mide exactitud, mide suerte. Lo que se compara con AlphaFold es la estructura representativa del conjunto: 0.85 Å.
09 · El hallazgo honesto

Por qué nunca vimos la proteína desplegarse

Este es el resultado que más honra al trabajo, porque es el que dice lo que no se pudo. Imagina un valle con dos hoyos separados por una loma. En un hoyo la proteína está plegada, en el otro desplegada. Para pasar de uno al otro hay que subir la loma.

Dónde arrancaron las 30 trayectorias

Las 30 trayectorias arrancaron todas dentro del hoyo de la izquierda, el estado plegado, y ninguna tuvo tiempo de subir la loma. Por eso la proteína pasó el 99.5 % del tiempo plegada y no hubo ni un solo evento de desplegamiento.

¿Cuánto tendría que durar cada trayectoria?

mueve el control
15 ns por trayectoria
muy baja oportunidad de ver una transición
lo que costaría en la RTX 4060

Modelo de juguete, sin valor predictivo. Solo ilustra que una ventana más larga da más oportunidad de atrapar un evento raro. Toma como referencia el tiempo característico de plegado de Chignolin (0.6 µs) que reporta la literatura, pero el evento que aquí faltó es el contrario, el desplegamiento, y su tasa no la medimos. Por eso la lectura es cualitativa y no dice cuántas trayectorias cruzarían.

Lo que esto sí significa

El montaje conserva la forma

La simulación mantuvo la estructura correcta durante 450 ns. Eso comprueba que el montaje es estable y razonable.

Lo que esto no significa

No mide la velocidad

Sin viajes de ida y vuelta entre los dos hoyos no hay manera de calcular cuánto tarda el plegamiento. El modelo de Markov que construimos solo separa variantes internas del estado plegado, así que sus tiempos no se reportan.

El error que hay que evitar a toda costa No digas que la proteína se quedó plegada porque el campo de fuerzas la sobre-estabiliza. Con trayectorias tan cortas y arrancando plegadas, se habría quedado plegada con casi cualquier campo de fuerzas. Ese 99.5 % no dice nada sobre el campo de fuerzas: dice algo sobre el diseño del muestreo.
10 · La aplicación

La PTR1, la enzima del parásito de Panamá

La leishmaniasis es endémica en Panamá y la causa sobre todo Leishmania panamensis. La PTR1 es una enzima que le abre al parásito una ruta de escape frente a ciertos medicamentos, por eso interesa como blanco. El problema: de esta especie no existe una estructura experimental. Ahí entra la computadora.

De dónde salió el modelo

AlphaFold + un cristal prestado

El monómero viene de AlphaFold DB. Las cuatro copias y los ligandos se ensamblaron usando el cristal 1E92 de L. major, una especie pariente con 73.9 % de identidad de secuencia.

Qué se simuló

4 réplicas de 100 ns

Cuatro simulaciones independientes, con semillas distintas, del sistema completo de 114 856 átomos: proteína, cofactor NADPH, sustrato, agua y sal.

Lo que hay que decir siempre

Es un modelo, no un hallazgo

No se descubrió ninguna estructura. Es un modelo computacional, y decirlo así es parte del rigor del trabajo.

Qué se repitió entre réplicas y qué no

porcentaje del tiempo que el contacto se mantuvo
Lys198 · NADPH100.0 %
Arg18 · NADPH89.1 %
Tyr194 · sustrato90.3 %
Ser112 · sustrato74.9 %

Los dos primeros son contactos con el cofactor y salieron casi idénticos en las cuatro réplicas. Los dos de abajo son contactos con el sustrato y variaron bastante de una réplica a otra: Ser112 se movió 19.9 puntos porcentuales arriba y abajo, y Tyr194, 18.1.

Gráfico de barras con la ocupancia de cuatro contactos y su desviación entre réplicas
Figura 3 del artículo, tal como se entregó. Es la misma información del gráfico de arriba, puesta aquí como evidencia original: las barras son la media entre las cuatro réplicas y la línea negra encima es la desviación, o sea cuánto cambió el resultado de una réplica a otra. Las líneas largas de los dos contactos con el sustrato son justamente el hallazgo. Ojo, en la figura del artículo las cuatro barras van del mismo color; el gráfico de arriba las separa en cian y ámbar para que se vea de un golpe cuáles son del cofactor y cuáles del sustrato.

Los cuatro sitios activos, réplica por réplica

El dato incómodo, que es el más valioso En la réplica 3, en uno de los cuatro sitios, la distancia media entre el cofactor y el sustrato fue de 16.7 Å. Para que reaccionen tienen que estar mucho más cerca, así que ahí la geometría reactiva no se sostuvo. Ojo con cómo lo dices: es una media, y una media no demuestra que estuviera lejos en todos los fotogramas. Eso no invalida el modelo: dice que la manera en que se acomodan cofactor y sustrato no es igual de reproducible en todos los sitios. Por eso la tercera hipótesis del trabajo quedó rechazada, y se reporta rechazada.
Cuidado con confundir dos cosas Las cuatro cadenas del tetrámero no son réplicas: son cuatro sitios del mismo sistema, que comparten todo. Las réplicas son las cuatro simulaciones distintas, cada una con su semilla. La incertidumbre se calculó entre réplicas, no entre cadenas.
11 · El balance

Al final, ¿qué logramos?

Dos entregas concretas: un modelo computacional de una enzima que no tenía ninguno, y un procedimiento abierto que otros pueden repetir o criticar. Más un mapa claro de hasta dónde llega ese procedimiento.

Lo que el trabajo sí sostiene 5 puntos

  • Con una tarjeta de US$300 y software libre se puede montar una simulación que conserva una estructura conocida con alta similitud: 0.85 Å contra la experimental.
  • Existe un modelo computacional del tetrámero de la PTR1 de L. panamensis, con su cofactor y su sustrato, una enzima para la que no encontramos estructura experimental depositada.
  • El esqueleto de esa enzima y el anclaje del cofactor NADPH se repitieron en cuatro simulaciones independientes. Hipótesis (ii) confirmada.
  • Todo el procedimiento, los parámetros y los archivos de partida están publicados, así que cualquier grupo puede repetirlo o auditarlo.
  • Se midió el rendimiento real del equipo y se dijo con números qué preguntas caben en ese presupuesto y cuáles no.

Lo que el trabajo no sostiene 6 puntos

  • No se midió la velocidad de plegamiento. No hubo transiciones entre plegado y desplegado, y sin eso no hay cinética.
  • No se descubrió ninguna estructura. La PTR1 es un modelo computacional, no una estructura resuelta en laboratorio.
  • No se demostró actividad, afinidad ni eficacia. La dinámica molecular clásica no simula la reacción química.
  • No se propone ningún medicamento ni se hizo búsqueda de candidatos.
  • Los contactos con el sustrato no fueron reproducibles entre réplicas. Hipótesis (iii) rechazada, y así se reporta.
  • El estado químico del sustrato no se validó de forma independiente, y el contacto de la Tyr114 es una observación exploratoria.

Qué preguntas cupieron en el presupuesto y cuáles no

pasa el cursor por cada punto

Cómo contestas «¿y esto para qué sirve?» Sirve para tres cosas concretas. Uno: hay un modelo de esta enzima donde antes había un vacío, y está abierto para que otros grupos lo tomen. Dos: queda un procedimiento documentado que un laboratorio con pocos recursos puede seguir, y en la región eso importa. Tres: quedó medido con números qué se puede y qué no se puede responder con este presupuesto, que es información útil para quien venga después y no quiera repetir el mismo tropiezo.
12 · Lo que viene

Qué sigue después

El artículo deja el siguiente paso escrito, y conviene decirlo en ese orden porque muestra que el equipo sabe dónde está parado.

1. Validar el estado químico del sustrato
Una misma molécula puede existir en variantes que se diferencian en dónde tiene un hidrógeno o una carga. Se eligió una de esas formas para simular y no se comprobó de forma independiente que fuera la correcta. Es lo primero que hay que amarrar, porque si la forma elegida no es la que existe en la célula, los contactos con el sustrato cambian.

La misma molécula, dos formas posibles. Cambia dónde está ese hidrógeno y cambia con quién puede pegarse dentro del sitio.

2. Contrastar las predicciones con evidencia de laboratorio
Nada de esto reemplaza un experimento. La ruta natural es llevarle el modelo a un grupo experimental que pueda contrastarlo.

Un modelo solo vale si se puede tumbar. El ciclo es este: la simulación propone algo concreto, el laboratorio lo mide, y el resultado confirma o corrige el modelo. Nosotros nos quedamos en el primer paso.

3. Muestreo mejorado para la energía: metadinámica o intercambio de réplicas
La metadinámica empuja a la simulación a salir de los hoyos donde se queda atrapada, de modo que llegue a estados que por su cuenta tardaría muchísimo en visitar. El intercambio de réplicas corre varias copias a temperaturas distintas y las va intercambiando, para que las más calientes ayuden a las más frías a cruzar las lomas. Cualquiera de las dos contestaría preguntas de energía que este muestreo no puede contestar.

Metadinámica: rellenar el hoyo hasta que salga

Cada vez que la partícula se queda dando vueltas en el mismo sitio, el método le echa un poquito de relleno debajo. El hoyo se va llenando y al final ya no la retiene. Ese relleno, además, es la medida de lo hondo que era el hoyo.

Intercambio de réplicas: las calientes ayudan a las frías

se intercambian solas

Cuatro copias del sistema, cada una a su temperatura. Las de arriba tienen energía de sobra para cruzar las lomas, y cuando dos vecinas se parecen lo suficiente se intercambian. Así la copia fría acaba visitando sitios a los que sola no habría llegado.

4. Disociación dirigida, para la cinética de unión
Consiste en empujar al ligando hacia afuera del sitio para medir cuánto le cuesta salir. Combinado con datos experimentales de anclaje, sirve para estimar tiempos de unión, que es justo el tipo de pregunta que este trabajo no pudo responder.

Disociación dirigida: empujar hasta que suelte

Se le aplica una fuerza al ligando en una dirección al azar y se cronometra cuánto tarda en salir. Repitiéndolo muchas veces se ve por dónde sale más fácil. Esto no lo hicimos: es la ruta, no el resultado.

El mensaje

Recursos accesibles como oportunidad.

Mantener la forma fue accesible. Ver toda la película, no. El límite lo puso el diseño de muestreo: trayectorias cortas que arrancan plegadas. Y de la PTR1 queda un modelo dinámico, abierto y auditable de una enzima que todavía no tiene estructura experimental, listo para que otros grupos lo tomen, lo critiquen y lo amplíen.