Estructura de proteínas en AlphaFold: pasos de ejecución
La predicción de estructura de proteínas con AlphaFold no es una conversión directa de una secuencia de aminoácidos en una imagen tridimensional.

Es una cadena de procesamiento con varias fases, representaciones intermedias y mecanismos de control de confianza. En AlphaFold2, el núcleo de cálculo está formado por 48 bloques Evoformer. El sistema combina información evolutiva, relaciones entre pares de residuos y refinamiento geométrico.
En predicciones de alta precisión, AlphaFold2 puede alcanzar valores de RMSD cercanos a 0,6–1,0 Å respecto a estructuras experimentales. Además, obtuvo una puntuación GDT superior a 90 sobre 100 en dos tercios de las proteínas evaluadas en CASP14. Estas cifras explican su impacto en bioinformática estructural. No demuestran que el modelo sustituya a la validación experimental ni que todas las regiones de una proteína tengan la misma fiabilidad.
La ejecución debe analizarse por etapas. Cada etapa resuelve un problema diferente: localizar señales evolutivas, construir relaciones entre residuos, generar coordenadas atómicas y estimar la incertidumbre.
1. Generación de la alineación de secuencias múltiples
La entrada básica es una secuencia de aminoácidos. Por sí sola, contiene información insuficiente para reconstruir con precisión todas las interacciones internas de la proteína. AlphaFold2 comienza buscando secuencias relacionadas en bases de datos genéticas y estructurales.
El resultado es una alineación de secuencias múltiples, conocida como MSA. La MSA coloca secuencias homólogas en posiciones comparables. El sistema analiza qué residuos tienden a conservarse y cuáles cambian de forma coordinada a lo largo de la evolución.
Este patrón de cambios es una señal de coevolución. Si dos posiciones mutan de forma compensatoria, puede existir una relación estructural o funcional entre ellas. No significa que cada correlación evolutiva corresponda a un contacto físico directo. La señal puede estar condicionada por la filogenia, por la calidad de las bases de datos o por la presencia de dominios repetidos. AlphaFold debe separar esas fuentes de ruido durante el procesamiento posterior.
La fase de MSA tiene varias implicaciones técnicas:
- La profundidad de la alineación condiciona la información disponible. Una familia proteica con muchos homólogos ofrece más patrones comparables que una secuencia huérfana o poco representada.
- La calidad de las secuencias afecta a la señal evolutiva. Secuencias incompletas, duplicadas o mal anotadas pueden introducir relaciones espurias.
- La cobertura no es uniforme. Un dominio puede estar bien representado y otro carecer casi por completo de homólogos.
- La coevolución no equivale a una estructura final. Es una entrada informativa para el modelo, no una lista de contactos que se convierta automáticamente en coordenadas.
En términos de infraestructura, esta fase puede convertirse en un cuello de botella. La consulta de bases de datos requiere almacenamiento, indexación y capacidad de lectura. En un entorno hospitalario o de investigación, la latencia de acceso a las bases de datos puede superar el tiempo dedicado al propio modelo neuronal. La escalabilidad depende tanto del acelerador empleado como de la estrategia de búsqueda y de la reutilización de resultados.
La calidad de la predicción empieza antes del modelo: una MSA pobre limita la información que el resto de la cadena puede recuperar.
AlphaFold no opera únicamente con una lista de secuencias. Mantiene representaciones estructuradas de la MSA y de las relaciones entre pares de residuos. Estas dos representaciones se actualizan durante el procesamiento. La primera describe patrones asociados a las secuencias homólogas. La segunda modela relaciones potenciales entre posiciones de la proteína.
Qué ocurre cuando la señal evolutiva es limitada
Una secuencia con pocos homólogos no queda automáticamente fuera del sistema. Sin embargo, cambia el perfil de incertidumbre. El modelo dispone de menos evidencia comparativa para inferir contactos, dominios y configuraciones alternativas.
En estos casos, la puntuación local puede ser desigual. Una región central y conservada puede obtener una confianza elevada, mientras que un extremo flexible o una inserción específica de la especie presenta valores inferiores. La interpretación debe hacerse por regiones, no mediante una única cifra global.
La ausencia de homólogos también impide extraer conclusiones fuertes sobre:
- segmentos intrínsecamente desordenados;
- conformaciones dependientes de ligandos;
- interfaces con otras proteínas;
- estados funcionales alternativos;
- regiones modificadas tras la traducción.
El modelo produce una hipótesis estructural. La ausencia de señal evolutiva no es una prueba de ausencia de estructura.
2. El núcleo de AlphaFold2: los 48 bloques Evoformer
La segunda fase se ejecuta en el módulo Evoformer. En AlphaFold2, este módulo contiene 48 bloques. Cada bloque procesa e interconecta dos representaciones principales:
1. la representación de la alineación de secuencias múltiples;
2. la representación por pares de residuos.
El objetivo no es aplicar 48 veces una misma operación de forma aislada. El sistema actualiza progresivamente la información. Los patrones observados en la MSA modifican las relaciones entre pares. A su vez, las relaciones por pares aportan contexto para interpretar la alineación.
Esta interacción es crítica. Una posición puede parecer relevante por su conservación, pero su función estructural depende de cómo se relaciona con otras posiciones. El modelo necesita representar relaciones a larga distancia. En proteínas grandes, dos residuos alejados en la secuencia pueden quedar próximos en el espacio tridimensional.
Representación de la MSA
La representación de la MSA conserva información sobre las secuencias relacionadas. Evoformer analiza variaciones, coincidencias y dependencias entre columnas de la alineación. No se limita a identificar residuos conservados. También intenta inferir qué cambios están vinculados.
La operación tiene un coste computacional sensible a la longitud de la secuencia y al número de secuencias incluidas. Una MSA extensa puede mejorar la señal, pero también aumenta el consumo de memoria y el tiempo de ejecución. La optimización no consiste en maximizar siempre el número de secuencias. Consiste en mantener una entrada informativa con una carga asumible.
Representación por pares
La representación por pares asigna información a combinaciones de residuos. Para una proteína de longitud L, el número de pares crece aproximadamente con L². Esta relación explica por qué las proteínas largas requieren más memoria y capacidad de cálculo.
El modelo actualiza estas relaciones mediante información derivada de la MSA y del propio contexto estructural. La representación por pares no constituye todavía una estructura tridimensional. Es un espacio intermedio donde se acumulan hipótesis sobre distancias, contactos y dependencias geométricas.
La diferencia entre ambas representaciones puede resumirse así:
| Representación | Información principal | Función durante el cálculo | Limitación operativa |
|---|---|---|---|
| MSA | Variaciones entre secuencias homólogas | Detectar conservación y patrones de coevolución | Depende de la disponibilidad y calidad de homólogos |
| Pares de residuos | Relaciones entre posiciones de la proteína | Integrar contactos y dependencias a larga distancia | El coste de memoria crece con la longitud de la secuencia |
| Representación estructural | Geometría y coordenadas de la molécula | Construir y refinar la conformación tridimensional | Debe interpretarse junto con las métricas de confianza |
En una instalación local, este comportamiento tiene consecuencias directas. La memoria de la GPU puede ser el límite principal. Aumentar el tamaño del acelerador no resuelve todos los problemas si la preparación de la MSA sigue siendo lenta o si la secuencia contiene regiones muy extensas.
El papel de la interconexión
El valor de Evoformer reside en la interconexión. Una predicción basada únicamente en la secuencia tendría menor acceso a relaciones evolutivas. Una predicción basada únicamente en pares no dispondría del contexto necesario para distinguir contactos plausibles de correlaciones accidentales.
El sistema combina ambos niveles. Esta combinación reduce la dependencia de reglas manuales. También dificulta la auditoría clásica del razonamiento interno. El resultado es una estructura y un conjunto de métricas, no una explicación molecular completa de cada contacto predicho.
Por ese motivo, una salida visualmente coherente no basta para validar una hipótesis farmacológica. El modelado de proteínas con IA puede priorizar estructuras, proponer interfaces o ayudar a diseñar experimentos. No determina por sí solo la afinidad de un ligando, la actividad catalítica ni la respuesta clínica.
3. Conversión a coordenadas tridimensionales
Tras el procesamiento en Evoformer, AlphaFold2 utiliza el módulo estructural. Esta fase convierte las representaciones abstractas en coordenadas tridimensionales concretas.
El módulo refina la geometría del esqueleto peptídico y de las cadenas laterales. Para ello utiliza atención equivariante frente a rotaciones. La propiedad es importante: si se rota la entrada, la predicción debe transformarse de forma coherente. La orientación absoluta de la proteína en el espacio no debe alterar su geometría interna.
El resultado son coordenadas atómicas. Estas coordenadas describen una conformación tridimensional compatible con las relaciones inferidas en las fases anteriores. El sistema no dibuja una estructura a partir de una plantilla fija. Construye la geometría utilizando representaciones aprendidas y operaciones específicas para objetos espaciales.
Del residuo a la geometría
Una proteína no es una cadena lineal sin restricciones. La predicción debe respetar:
- la conectividad del esqueleto peptídico;
- los ángulos internos;
- la orientación de las cadenas laterales;
- la proximidad entre residuos;
- la compatibilidad espacial de los dominios;
- la ausencia de conflictos geométricos evidentes.
El módulo estructural ajusta estos elementos de forma conjunta. Un cambio en la posición de un residuo puede modificar la configuración de varios vecinos. Por ello, la construcción no se interpreta como una sucesión independiente de decisiones por aminoácido.
La precisión tampoco es uniforme. Los dominios compactos y bien definidos suelen ser más estables que los bucles móviles. Las interfaces entre dominios pueden mostrar menor confianza que el interior de cada dominio. El análisis debe distinguir entre error local y error relativo entre regiones.
Estructura predicha frente a estado funcional
La predicción representa una configuración plausible. No garantiza que sea la conformación predominante en una célula concreta. Las proteínas pueden cambiar de estado al unirse a:
- otras proteínas;
- ácidos nucleicos;
- cofactores;
- membranas;
- ligandos de bajo peso molecular;
- modificaciones químicas.
Una estructura aislada puede ser útil para generar hipótesis. Sin embargo, el uso de AlphaFold en bioinformática debe incorporar el contexto de la pregunta. No se exige el mismo nivel de evidencia para anotar un dominio que para seleccionar un compuesto candidato o interpretar una variante genética.
En farmacogenómica, esta distinción es operativa. Una variante puede alterar la estabilidad, el plegamiento, la interacción con un sustrato o el transporte celular. Una estructura predicha puede ayudar a localizar la variante en un dominio o cerca de una interfaz. No convierte automáticamente ese emplazamiento en una conclusión clínica.
4. Reciclaje y refinamiento de la predicción
AlphaFold2 incorpora un mecanismo de reciclaje. Las salidas del módulo estructural y del Evoformer se vuelven a introducir en el sistema. El proceso se repite para refinar la predicción.
El reciclaje permite corregir inconsistencias que no se resuelven en una única pasada. La geometría generada por el módulo estructural aporta información adicional. Esa información puede modificar las representaciones internas y producir una configuración más coherente en la siguiente iteración.
No debe interpretarse como una garantía de convergencia correcta. Repetir el procesamiento no convierte una entrada deficiente en una estructura experimental. Si la MSA no contiene señales suficientes o la proteína presenta múltiples estados, el reciclaje puede estabilizar una hipótesis sin resolver la ambigüedad biológica.
El comportamiento debe valorarse con tres preguntas:
1. ¿La geometría mejora de manera consistente?
Una estructura refinada debe mostrar relaciones internas más coherentes, no solo una apariencia visual más compacta.
2. ¿La confianza se concentra en las regiones adecuadas?
Un dominio estable puede presentar alta confianza aunque los conectores sean flexibles. Esa distribución es más informativa que una media global.
3. ¿La predicción responde a la pregunta experimental?
Una estructura de monómero no resuelve necesariamente una cuestión sobre un complejo, un ligando o una interacción entre proteínas.
pLDDT: confianza local por residuo
AlphaFold2 proporciona pLDDT, una métrica de confianza local por residuo. Permite identificar qué segmentos de la estructura presentan mayor o menor fiabilidad.
El pLDDT no debe leerse como una probabilidad clínica ni como una medida directa de exactitud atómica para toda la molécula. Es una señal local. Un valor elevado en una región indica que el modelo tiene más confianza en la geometría de ese segmento. Un valor bajo puede asociarse a flexibilidad, desorden, ausencia de información evolutiva o ambigüedad estructural.
El análisis práctico debe buscar patrones:
- valores altos y continuos en un dominio compacto;
- descensos localizados en bucles o extremos;
- cambios bruscos en conectores entre dominios;
- segmentos largos con confianza baja;
- diferencias entre regiones que parecen próximas en la representación final.
La media de pLDDT puede ocultar estos contrastes. Para una decisión de diseño molecular, una región concreta suele ser más importante que la media de la proteína completa.
PAE: error alineado previsto
La matriz PAE describe el error relativo previsto entre posiciones o regiones cuando una parte de la estructura se utiliza como referencia. Es especialmente útil para analizar la orientación entre dominios.
Una proteína puede tener dos dominios individualmente bien definidos y, al mismo tiempo, una relación espacial incierta entre ambos. En ese caso, el pLDDT de cada dominio puede ser alto, pero la matriz PAE mostrará incertidumbre en la disposición relativa.
Esta distinción evita un error frecuente: interpretar una estructura global compacta como una conformación confirmada. El sistema puede conocer con bastante precisión la forma de cada dominio y no saber cómo se orientan entre sí.
La lectura conjunta de ambas métricas es más robusta:
| Señal | Qué informa | Qué no demuestra |
|---|---|---|
| pLDDT alto | Confianza local en una región concreta | Que toda la proteína esté correctamente orientada |
| pLDDT bajo | Incertidumbre local, flexibilidad o falta de señal | Que la región carezca de función biológica |
| PAE bajo entre regiones | Relación espacial relativamente consistente | Que exista una interacción funcional |
| PAE alto entre regiones | Orientación relativa incierta | Que los dominios no puedan asociarse en condiciones celulares |
pLDDT responde a la pregunta local. PAE responde a la pregunta relativa. Confundir ambas métricas produce errores de interpretación.
5. Cómo ejecutar el análisis sin confundir salida y evidencia
La ejecución de AlphaFold debe integrarse en una cadena reproducible. El orden de trabajo importa. También importa conservar los datos intermedios.
Un procedimiento técnico razonable incluye los pasos siguientes:
1. Definir la secuencia de entrada.
Debe conservarse la versión exacta de la secuencia, incluyendo isoforma, mutaciones y longitud. Una sustitución de aminoácido puede modificar la interpretación de la salida.
2. Comprobar la representación biológica.
La secuencia puede corresponder a un monómero, una isoforma o una región truncada. El modelo no puede inferir de forma fiable un contexto que no se haya incluido.
3. Construir la MSA.
La búsqueda debe quedar registrada. Conviene conservar las bases de datos empleadas, la fecha de consulta y los parámetros de filtrado.
4. Ejecutar el procesamiento principal.
La configuración de hardware condiciona la latencia y la memoria disponible. Las ejecuciones deben registrar versión del software, modelo utilizado y recursos asignados.
5. Analizar la estructura con pLDDT y PAE.
La revisión no debe limitarse a abrir el archivo tridimensional. Hay que identificar regiones de confianza alta, segmentos ambiguos y relaciones inciertas entre dominios.
6. Contrastar con información independiente.
La estructura predicha debe compararse con datos experimentales disponibles, anotaciones de dominio, mutaciones conocidas o resultados funcionales.
7. Separar hipótesis de decisión.
Una predicción puede servir para priorizar experimentos. No debe presentarse como prueba definitiva de mecanismo farmacológico o de respuesta terapéutica.
Reproducibilidad y trazabilidad
En investigación biomédica, el archivo de coordenadas es solo una parte del resultado. También se necesita conservar la configuración que generó la predicción. Sin esa información, una segunda ejecución puede producir una salida difícil de comparar.
La trazabilidad mínima debe incluir:
- secuencia completa y origen de la anotación;
- versión de las bases de datos;
- MSA generada;
- modelo de AlphaFold utilizado;
- número de reciclajes configurado, cuando esté disponible;
- hardware y memoria empleada;
- métricas pLDDT y PAE;
- fecha de ejecución;
- modificaciones manuales posteriores.
La interoperabilidad también afecta al flujo de trabajo. La estructura puede exportarse a herramientas de visualización, análisis de dominios, acoplamiento molecular o comparación estructural. Cada transferencia debe conservar la correspondencia entre residuos. Un desfase de numeración puede invalidar el análisis de una variante.
Errores operativos frecuentes
El uso del sistema falla más por interpretación que por generación de coordenadas. Los errores más habituales son concretos:
- Analizar solo la imagen tridimensional. La apariencia compacta no es una métrica de precisión.
- Usar la media global como criterio único. Oculta dominios fiables y regiones ambiguas.
- Tratar un pLDDT bajo como ausencia de función. La flexibilidad puede ser funcional.
- Confundir proximidad geométrica con interacción. Dos residuos próximos en una predicción no prueban una unión real.
- Comparar secuencias sin controlar las isoformas. Una diferencia de longitud puede crear falsos cambios estructurales.
- Ignorar la PAE entre dominios. La orientación relativa puede ser incierta aunque cada dominio tenga buena definición.
- Utilizar la salida como evidencia regulatoria final. La validación experimental sigue siendo necesaria para aplicaciones médicas reguladas.
- No registrar la configuración. Sin trazabilidad, la reproducibilidad queda comprometida.
AlphaFold3: cambio de arquitectura y ampliación del alcance
AlphaFold3 modifica la cadena de procesamiento respecto a AlphaFold2. Simplifica el tratamiento de la MSA y sustituye el Evoformer por el módulo Pairformer. Después genera las coordenadas de todos los átomos individuales mediante un modelo generativo basado en difusión.
La diferencia no es menor. AlphaFold2 se diseñó principalmente para predecir estructuras proteicas con una arquitectura centrada en la MSA, el Evoformer y el módulo estructural. AlphaFold3 amplía el tipo de complejos biomoleculares que puede abordar y cambia el mecanismo de generación geométrica.
La difusión introduce un proceso generativo para construir las coordenadas atómicas. El modelo parte de una representación ruidosa y la refina hacia una configuración molecular coherente. No debe trasladarse este mecanismo a AlphaFold2. AlphaFold2 no utiliza difusión para generar la estructura tridimensional.
Los resultados comunicados para AlphaFold3 indican una precisión un 50 % superior a métodos tradicionales en la prueba PoseBusters. Esa cifra pertenece a un contexto de evaluación concreto. No equivale a una mejora uniforme en todas las proteínas, complejos o condiciones experimentales.
La comparación puede resumirse de la siguiente manera:
| Elemento | AlphaFold2 | AlphaFold3 |
|---|---|---|
| Tratamiento de la MSA | Parte central de la cadena de procesamiento | Procesamiento simplificado respecto a AlphaFold2 |
| Módulo principal de representación | Evoformer con 48 bloques | Pairformer |
| Generación estructural | Módulo estructural con atención equivariante | Modelo generativo basado en difusión |
| Nivel de coordenadas | Predicción de la estructura proteica | Coordenadas de átomos individuales en complejos compatibles |
| Métricas de confianza | pLDDT y PAE | La interpretación depende del sistema y de la salida disponible |
| Uso práctico | Modelado estructural y análisis de dominios | Complejos biomoleculares y problemas estructurales más amplios |
El cambio arquitectónico amplía las posibilidades, pero no elimina las limitaciones. La predicción de un complejo no prueba que ese complejo exista en la célula, que mantenga esa conformación o que produzca una respuesta terapéutica. El contexto bioquímico sigue siendo determinante.
Qué modelo debe utilizar un equipo de investigación
La elección no debe basarse en la novedad del sistema. Debe depender de la pregunta y de la infraestructura disponible.
Para una proteína aislada, AlphaFold2 puede ofrecer una salida suficiente si el objetivo es estudiar dominios, localizar variantes o generar una hipótesis estructural inicial. Para complejos biomoleculares y coordenadas atómicas más amplias, AlphaFold3 puede ser más adecuado, siempre que el acceso, la reproducibilidad y las condiciones de uso sean compatibles con el proyecto.
El equipo debe valorar:
- tipo de molécula que se quiere modelar;
- presencia de ligandos, ácidos nucleicos o múltiples cadenas;
- disponibilidad de datos experimentales;
- latencia admisible;
- capacidad de GPU y memoria;
- necesidad de ejecución local;
- requisitos de trazabilidad;
- sensibilidad de las secuencias clínicas;
- facilidad de integración con las herramientas existentes.
En un hospital, la protección de datos genéticos añade una restricción específica. Las secuencias de pacientes no deben enviarse a servicios externos sin una evaluación previa de gobernanza, seguridad e interoperabilidad. El rendimiento computacional no puede analizarse separado del control de acceso y de la gestión del dato.
Qué aporta AlphaFold al descubrimiento de fármacos
La estructura predicha puede reducir el coste inicial de algunas tareas. Permite priorizar proteínas, localizar cavidades plausibles y organizar hipótesis sobre variantes. También facilita la anotación estructural cuando no existe una estructura experimental disponible.
Su utilidad aumenta cuando se incorpora a una cadena de análisis más amplia:
- secuenciación de ADN;
- identificación de variantes;
- anotación de dominios;
- simulación molecular;
- selección de compuestos;
- ensayos bioquímicos;
- validación celular;
- confirmación estructural.
AlphaFold no sustituye estas fases. Su valor está en reducir la incertidumbre inicial y mejorar la priorización. La tasa de error relevante no es únicamente la de la coordenada estructural. También cuentan los falsos positivos en la selección de dianas, las interacciones que no se reproducen en laboratorio y las variantes cuyo efecto biológico depende de mecanismos ajenos al plegamiento.
En medicina personalizada, una estructura puede aportar contexto, pero no una recomendación terapéutica automática. La respuesta a un fármaco depende de farmacocinética, expresión génica, metabolismo, interacciones, estado clínico y otros factores. La farmacogenómica necesita integrar la estructura con datos clínicos y funcionales.
Veredicto técnico
AlphaFold2 ejecuta una cadena secuencial bien definida: genera una MSA, procesa la información mediante 48 bloques Evoformer, transforma las representaciones en coordenadas tridimensionales y refina el resultado mediante reciclaje. Las métricas pLDDT y PAE permiten evaluar la confianza local y las relaciones entre regiones.
El sistema es especialmente útil para generar hipótesis estructurales y priorizar análisis. Su salida no debe confundirse con una estructura experimental ni con una prueba de función. La arquitectura, la calidad de la MSA, la longitud de la proteína y el contexto molecular determinan la utilidad final.
AlphaFold3 amplía el alcance mediante Pairformer y difusión generativa. La mejora de precisión observada en evaluaciones específicas no elimina la necesidad de control experimental. En un entorno clínico o farmacéutico, la decisión correcta sigue dependiendo de la trazabilidad, la interoperabilidad, la tasa de error y la validación independiente.
La infraestructura puede acelerar el análisis. No puede reemplazar la evidencia.