Una simulación de proteínas corrida en una tarjeta gráfica de videojuegos.
Aquí está cada pieza del proyecto convertida en algo que puedes mover, mirar y entender
antes de explicárselo al jurado.
US$300
la tarjeta con la que se corrió todo
450 ns
de movimiento simulado en Chignolin
114 856
átomos en el sistema de la PTR1
0
eventos de desplegamiento vistos
Cada número de esta página sale del artículo entregado a la JIC. Nada está redondeado
hacia arriba ni inventado para que suene mejor.
01 · Biología
Una proteína es un collar que se dobla solo
Toda proteína nace como una cadena estirada de piezas llamadas aminoácidos. En cuestión de
microsegundos esa cadena se dobla sola, sin que nadie la ayude, hasta una forma tridimensional
exacta. Y esa forma es la que decide qué sabe hacer.
Chignolin, la proteína más pequeña del proyecto
Diez esferas, diez aminoácidos. Cuando la cadena se dobla, los extremos se juntan y forman
una horquilla. Es un esquema, no la geometría exacta de la molécula.
La regla de oro
Forma = función
Una proteína hace lo que hace por la forma que toma. Cambia la forma y cambia el trabajo,
o deja de servir. Por eso conocer la forma es conocer la proteína.
Por qué importa
Si se pliega mal, hay problema
Varias enfermedades aparecen cuando una proteína se dobla mal. Entender el plegamiento
es entender cómo se llega a la forma correcta y qué pasa cuando no se llega.
Cómo lo dices en la defensa
Una proteína es un collar de piezas que se dobla solo hasta una forma exacta, y esa forma es
la que decide su función. Chignolin tiene apenas diez piezas, por eso cabe en una simulación corta.
02 · La idea del proyecto
AlphaFold da la foto. La dinámica molecular da la película
Esta es la idea que sostiene todo el trabajo. AlphaFold, la inteligencia artificial que ganó
el Nobel, predice la forma final de una proteína. Pero una foto no te dice cómo se llegó ahí
ni cuánto tardó. Para eso hay que simular el movimiento átomo por átomo.
La misma proteína, dos maneras de mirarla
AlphaFold · predicción
La foto
Una sola imagen fija de la forma más probable. Es rapidísima y muy
buena, pero está congelada: no dice cómo ni cuándo se dobló.
Dinámica molecular · simulación
La película
Miles de fotogramas seguidos. Con muestreo suficiente llega a los
pasos intermedios y a la velocidad del plegado. Este trabajo no alcanzó esa parte.
La respuesta a «¿AlphaFold no resolvió ya todo esto?»
AlphaFold resolvió predecir la forma final, y lo hace muy bien. No resolvió el movimiento.
Una proteína no es una estatua: se dobla, respira, abre y cierra huecos, y ese movimiento es
parte de su función. Las dos herramientas no compiten, se complementan: una dice cómo es la
proteína, la otra cómo llega a serlo.
03 · La pieza clave
La regla del tiempo
Si entiendes esta sola imagen, entiendes el resultado principal del proyecto. Mueve el control
y mira dónde cae cada cosa. Cada marca de la regla es diez veces más grande que la anterior.
De un paso de cálculo a un parpadeo
arrastra el control
15 ns
Lo que dura una sola de nuestras trayectorias.
Lo que sí alcanzamos
450 ns
Todo el movimiento simulado de Chignolin, sumando las 30 trayectorias.
Lo que hacía falta
0.6 µs
El tiempo que tarda Chignolin en plegarse según la literatura. Unas 40 veces más que cada
una de nuestras ventanas de 15 ns.
Lo que cuesta
~140 ns/día
El rendimiento medido en la tarjeta con el sistema de la PTR1. Un microsegundo se lleva
del orden de una semana de cálculo continuo.
Esta es la respuesta honesta del proyecto
Cada trayectoria duró 15 nanosegundos y el evento que queríamos ver tarda unas 40 veces más.
Es como grabar 40 veces un partido de fútbol, pero solo los primeros dos minutos de cada uno:
por más veces que grabes, nunca vas a ver un gol del segundo tiempo. Por eso no medimos la
velocidad de plegamiento, y por eso el siguiente paso es rediseñar el muestreo, no comprar
una tarjeta más grande.
04 · El motor
Qué hace exactamente la tarjeta gráfica
En cada paso de la simulación hay que calcular la fuerza que siente cada átomo por culpa de
todos los demás. Con 114 856 átomos eso son millones de cuentas, y hay que repetirlas millones
de veces. La gracia de la tarjeta gráfica es que hace muchísimas cuentas a la vez.
Mismo trabajo, dos maneras de repartirlo
Analogía, no una medición. Lo real es que la simulación se hizo en la tarjeta gráfica porque
este tipo de cálculo se reparte bien entre muchos núcleos pequeños trabajando a la vez.
El rol de la tarjeta
Resuelve la física
Conoce las fuerzas entre átomos y calcula hacia dónde se mueve cada uno. Repite ese cálculo
cada 4 femtosegundos, millones de veces seguidas. Eso es la dinámica molecular.
El rol del procesador
Organiza y guarda
Prepara el sistema, lanza cada trayectoria, guarda un fotograma cada cierto tiempo y hace
los análisis después. El trabajo pesado y repetitivo va a la tarjeta.
05 · La decisión
¿Por qué una sola tarjeta y no varias?
Es la pregunta más probable del jurado, y tiene una respuesta corta: porque esa era la pregunta
del proyecto, no una limitación que estemos tapando.
Razón 1
Era la pregunta
El trabajo mide hasta dónde llega la simulación con recursos que un grupo estudiantil sí
puede tener. Si usábamos un clúster, el resultado no contestaba esa pregunta.
Razón 2
Para que otros lo repitan
Un laboratorio pequeño de la región puede conseguir una tarjeta de US$300. Un resultado
obtenido así se puede repetir en muchos más lugares.
Razón 3
Más tarjetas, solas, no bastaban
Con más máquinas se acumula más tiempo simulado, y eso ayuda. Pero el sesgo de arrancar
todas las trayectorias desde la proteína ya plegada no se corrige multiplicando corridas
iguales: hay que cambiar de dónde parten.
Pruébalo: ¿y si hubiéramos tenido más tarjetas?
mueve el control
1 tarjeta
30 trayectorias
450 ns acumulados
0.45 µs agregados
Cuenta orientativa, no un dato del trabajo. Toma como referencia el tiempo característico de
plegado de Chignolin (0.6 µs) y supone que las transiciones ocurren al azar. El evento que
aquí no se vio es el contrario, el desplegamiento; a 340 K los dos tiempos son del mismo
orden, pero no son el mismo número.
Si te preguntan por IBEROGUN, el clúster de la universidad
Se responde sin ponerse a la defensiva: el clúster existe y es una opción real para el siguiente
paso. No era el punto de este trabajo. Reproducir la forma salió con hardware modesto, y medir
el plegamiento pide otro diseño de muestreo. Con más máquinas se acumula más tiempo simulado,
pero primero hay que cambiar de dónde arrancan las trayectorias.
06 · El método
El paso a paso, sin misterio
Cuatro etapas. Cada una vive en un script numerado del repositorio, así que cualquiera puede
repetir la corrida completa.
La metemos en agua con sal
07 · La estrategia
Muestreo ramificado: 30 corridas cortas en vez de una larga
En lugar de dejar corriendo una sola simulación larguísima, se lanzaron muchas cortas e
independientes. La idea viene de Folding@home, el proyecto que reparte simulaciones entre
cientos de miles de computadoras del mundo. Aquí todo corrió en una sola tarjeta.
Tres rondas, diez trayectorias cada una
Ronda 1: diez trayectorias desde el sistema equilibrado. Rondas 2 y 3: diez más cada una,
arrancando desde los estados finales de la ronda anterior. En total 30 trayectorias de 15 ns
que suman 450 ns.
Qué gana este diseño
Se reparte y se reanuda
Si una corrida falla o se apaga la máquina, se pierde solo esa. Y se puede repartir entre
varias computadoras sin cambiar nada del método.
Lo que hay que aclarar
No es muestreo adaptativo
Un muestreo adaptativo de verdad agrupa lo ya visto y decide desde dónde seguir para
explorar lo que falta. El nuestro reparte por turnos entre los estados finales, sin esa
decisión. Es honesto decirlo así.
Nunca digas esto
No digas que montaron un "mini Folding@home". Folding@home solo inspiró la idea de usar muchos
trabajos cortos. Las corridas fueron locales, con OpenMM, en una sola tarjeta.
08 · El resultado
Qué significa 0.85 Å
El ángström es la unidad con la que se miden los átomos. Un átomo de carbono mide alrededor de
1.7 Å de radio. O sea que las diferencias de las que hablamos son más chicas que un solo átomo.
Cuánto se separan dos estructuras
mueve el control o toca una marca
Las tres estructuras de verdad, en 3D
arrástrala para girarla
Esto no es un dibujo: son las coordenadas reales de los diez carbonos alfa de cada estructura,
leídas de los archivos del proyecto y superpuestas con el mismo método del artículo. Por eso al
medirlas aquí dan 0.90 Å para AlphaFold2 y 0.85 Å para la
simulación, los mismos números de la lámina. Gírala y vas a ver que las tres van casi por el
mismo camino, y que donde más se separan es en los extremos de la cadena.
La figura real del artículo. Las tres estructuras de Chignolin superpuestas: la experimental,
la predicción de AlphaFold2 y la estructura representativa de la simulación. Coinciden en lo
esencial y se separan un poco en algunas cadenas laterales, que son las partes que se mueven
con más libertad.
La trampa que tienes que desarmar antes de que te la pongan
Parece que 0.85 Å le gana a los 0.90 Å de AlphaFold. No es una carrera y no se compara así.
AlphaFold predijo a ciegas, solo con la secuencia. Nuestra simulación arrancó desde la
estructura experimental, así que su 0.85 Å mide que la conservó, no que la haya adivinado. Son
dos cosas distintas medidas con la misma regla.
Y la otra trampa
En el conjunto de 22 500 fotogramas hubo uno que llegó a 0.15 Å. Ese número no se usa y hay que
saber por qué: es el mejor de miles, y mientras más fotogramas guardes, más chiquito te va a
salir. No mide exactitud, mide suerte. Lo que se compara con AlphaFold es la estructura
representativa del conjunto: 0.85 Å.
09 · El hallazgo honesto
Por qué nunca vimos la proteína desplegarse
Este es el resultado que más honra al trabajo, porque es el que dice lo que no se pudo. Imagina
un valle con dos hoyos separados por una loma. En un hoyo la proteína está plegada, en el otro
desplegada. Para pasar de uno al otro hay que subir la loma.
Dónde arrancaron las 30 trayectorias
Las 30 trayectorias arrancaron todas dentro del hoyo de la izquierda, el estado plegado, y
ninguna tuvo tiempo de subir la loma. Por eso la proteína pasó el 99.5 % del tiempo plegada
y no hubo ni un solo evento de desplegamiento.
¿Cuánto tendría que durar cada trayectoria?
mueve el control
15 ns por trayectoria
muy baja oportunidad de ver una transición
lo que costaría en la RTX 4060
Modelo de juguete, sin valor predictivo. Solo ilustra que una ventana más
larga da más oportunidad de atrapar un evento raro. Toma como referencia el tiempo
característico de plegado de Chignolin (0.6 µs) que reporta la literatura, pero el
evento que aquí faltó es el contrario, el desplegamiento, y su tasa no la medimos. Por eso la
lectura es cualitativa y no dice cuántas trayectorias cruzarían.
Lo que esto sí significa
El montaje conserva la forma
La simulación mantuvo la estructura correcta durante 450 ns. Eso comprueba que el montaje
es estable y razonable.
Lo que esto no significa
No mide la velocidad
Sin viajes de ida y vuelta entre los dos hoyos no hay manera de calcular cuánto tarda el
plegamiento. El modelo de Markov que construimos solo separa variantes internas del estado
plegado, así que sus tiempos no se reportan.
El error que hay que evitar a toda costa
No digas que la proteína se quedó plegada porque el campo de fuerzas la sobre-estabiliza. Con
trayectorias tan cortas y arrancando plegadas, se habría quedado plegada con casi cualquier
campo de fuerzas. Ese 99.5 % no dice nada sobre el campo de fuerzas: dice algo sobre el diseño
del muestreo.
10 · La aplicación
La PTR1, la enzima del parásito de Panamá
La leishmaniasis es endémica en Panamá y la causa sobre todo Leishmania panamensis. La
PTR1 es una enzima que le abre al parásito una ruta de escape frente a ciertos medicamentos, por
eso interesa como blanco. El problema: de esta especie no existe una estructura experimental.
Ahí entra la computadora.
De dónde salió el modelo
AlphaFold + un cristal prestado
El monómero viene de AlphaFold DB. Las cuatro copias y los ligandos se ensamblaron usando
el cristal 1E92 de L. major, una especie pariente con 73.9 % de identidad de secuencia.
Qué se simuló
4 réplicas de 100 ns
Cuatro simulaciones independientes, con semillas distintas, del sistema completo de
114 856 átomos: proteína, cofactor NADPH, sustrato, agua y sal.
Lo que hay que decir siempre
Es un modelo, no un hallazgo
No se descubrió ninguna estructura. Es un modelo computacional, y decirlo así es parte del
rigor del trabajo.
Qué se repitió entre réplicas y qué no
porcentaje del tiempo que el contacto se mantuvo
Lys198 · NADPH100.0 %
Arg18 · NADPH89.1 %
Tyr194 · sustrato90.3 %
Ser112 · sustrato74.9 %
Los dos primeros son contactos con el cofactor y salieron casi idénticos en las cuatro
réplicas. Los dos de abajo son contactos con el sustrato y variaron bastante de una réplica a
otra: Ser112 se movió 19.9 puntos porcentuales arriba y abajo, y Tyr194, 18.1.
Figura 3 del artículo, tal como se entregó. Es la misma información del gráfico de arriba,
puesta aquí como evidencia original: las barras son la media entre las cuatro réplicas y la
línea negra encima es la desviación, o sea cuánto cambió el resultado de una réplica a otra.
Las líneas largas de los dos contactos con el sustrato son justamente el hallazgo. Ojo, en la
figura del artículo las cuatro barras van del mismo color; el gráfico de arriba las separa en
cian y ámbar para que se vea de un golpe cuáles son del cofactor y cuáles del sustrato.
Los cuatro sitios activos, réplica por réplica
El dato incómodo, que es el más valioso
En la réplica 3, en uno de los cuatro sitios, la distancia media entre el cofactor y el sustrato
fue de 16.7 Å. Para que reaccionen tienen que estar mucho más cerca, así que ahí la geometría
reactiva no se sostuvo. Ojo con cómo lo dices: es una media, y una media no
demuestra que estuviera lejos en todos los fotogramas. Eso no invalida el modelo: dice que la manera en que se acomodan cofactor
y sustrato no es igual de reproducible en todos los sitios. Por eso la tercera hipótesis del
trabajo quedó rechazada, y se reporta rechazada.
Cuidado con confundir dos cosas
Las cuatro cadenas del tetrámero no son réplicas: son cuatro sitios del mismo sistema, que
comparten todo. Las réplicas son las cuatro simulaciones distintas, cada una con su semilla.
La incertidumbre se calculó entre réplicas, no entre cadenas.
11 · El balance
Al final, ¿qué logramos?
Dos entregas concretas: un modelo computacional de una enzima que no tenía ninguno, y un
procedimiento abierto que otros pueden repetir o criticar. Más un mapa claro de hasta dónde
llega ese procedimiento.
Lo que el trabajo sí sostiene 5 puntos
Con una tarjeta de US$300 y software libre se puede montar una simulación que conserva
una estructura conocida con alta similitud: 0.85 Å contra la experimental.
Existe un modelo computacional del tetrámero de la PTR1 de L. panamensis, con su
cofactor y su sustrato, una enzima para la que no encontramos estructura experimental
depositada.
El esqueleto de esa enzima y el anclaje del cofactor NADPH se repitieron en cuatro
simulaciones independientes. Hipótesis (ii) confirmada.
Todo el procedimiento, los parámetros y los archivos de partida están publicados, así
que cualquier grupo puede repetirlo o auditarlo.
Se midió el rendimiento real del equipo y se dijo con números qué preguntas caben en ese
presupuesto y cuáles no.
Lo que el trabajo no sostiene 6 puntos
No se midió la velocidad de plegamiento. No hubo transiciones entre plegado y desplegado,
y sin eso no hay cinética.
No se descubrió ninguna estructura. La PTR1 es un modelo computacional, no una estructura
resuelta en laboratorio.
No se demostró actividad, afinidad ni eficacia. La dinámica molecular clásica no simula
la reacción química.
No se propone ningún medicamento ni se hizo búsqueda de candidatos.
Los contactos con el sustrato no fueron reproducibles entre réplicas. Hipótesis (iii)
rechazada, y así se reporta.
El estado químico del sustrato no se validó de forma independiente, y el contacto de la
Tyr114 es una observación exploratoria.
Qué preguntas cupieron en el presupuesto y cuáles no
pasa el cursor por cada punto
Cómo contestas «¿y esto para qué sirve?»
Sirve para tres cosas concretas. Uno: hay un modelo de esta enzima donde antes había un vacío,
y está abierto para que otros grupos lo tomen. Dos: queda un procedimiento documentado que un
laboratorio con pocos recursos puede seguir, y en la región eso importa. Tres: quedó medido con
números qué se puede y qué no se puede responder con este presupuesto, que es información útil
para quien venga después y no quiera repetir el mismo tropiezo.
12 · Lo que viene
Qué sigue después
El artículo deja el siguiente paso escrito, y conviene decirlo en ese orden porque muestra que
el equipo sabe dónde está parado.
1. Validar el estado químico del sustrato
Una misma molécula puede existir en variantes que se diferencian en dónde tiene un hidrógeno
o una carga. Se eligió una de esas formas para simular y no se comprobó de forma
independiente que fuera la correcta. Es lo primero que hay que amarrar, porque si la forma
elegida no es la que existe en la célula, los contactos con el sustrato cambian.
La misma molécula, dos formas posibles. Cambia dónde está ese
hidrógeno y cambia con quién puede pegarse dentro del sitio.
2. Contrastar las predicciones con evidencia de laboratorio
Nada de esto reemplaza un experimento. La ruta natural es llevarle el modelo a un grupo
experimental que pueda contrastarlo.
Un modelo solo vale si se puede tumbar. El ciclo es este: la simulación
propone algo concreto, el laboratorio lo mide, y el resultado confirma o corrige el modelo.
Nosotros nos quedamos en el primer paso.
3. Muestreo mejorado para la energía: metadinámica o intercambio de réplicas
La metadinámica empuja a la simulación a salir de los hoyos donde se queda atrapada, de modo
que llegue a estados que por su cuenta tardaría muchísimo en visitar. El intercambio de
réplicas corre varias copias a temperaturas distintas y las va intercambiando, para que las
más calientes ayuden a las más frías a cruzar las lomas. Cualquiera de las dos contestaría
preguntas de energía que este muestreo no puede contestar.
Metadinámica: rellenar el hoyo hasta que salga
Cada vez que la partícula se queda dando vueltas en el mismo sitio, el
método le echa un poquito de relleno debajo. El hoyo se va llenando y al final ya no la
retiene. Ese relleno, además, es la medida de lo hondo que era el hoyo.
Intercambio de réplicas: las calientes ayudan a las frías
se intercambian solas
Cuatro copias del sistema, cada una a su temperatura. Las de arriba
tienen energía de sobra para cruzar las lomas, y cuando dos vecinas se parecen lo suficiente
se intercambian. Así la copia fría acaba visitando sitios a los que sola no habría llegado.
4. Disociación dirigida, para la cinética de unión
Consiste en empujar al ligando hacia afuera del sitio para medir cuánto le cuesta salir.
Combinado con datos experimentales de anclaje, sirve para estimar tiempos de unión, que es
justo el tipo de pregunta que este trabajo no pudo responder.
Disociación dirigida: empujar hasta que suelte
Se le aplica una fuerza al ligando en una dirección al azar y se
cronometra cuánto tarda en salir. Repitiéndolo muchas veces se ve por dónde sale más fácil.
Esto no lo hicimos: es la ruta, no el resultado.
El mensaje
Recursos accesibles como oportunidad.
Mantener la forma fue accesible. Ver toda la película, no. El límite lo puso el diseño de
muestreo: trayectorias cortas que arrancan plegadas. Y de la PTR1 queda un modelo dinámico,
abierto y auditable de una enzima que todavía no tiene estructura experimental, listo para que
otros grupos lo tomen, lo critiquen y lo amplíen.