Inteligencia Artificial (IA)
Una nueva forma de aumentar las capacidades de los grandes modelos de lenguaje
3 min de lectura
21.12.2025
Investigadores del MIT-IBM Watson AI Lab presentan PaTH Attention, una codificación posicional adaptable que mejora el seguimiento de estados y el razonamiento secuencial en LLMs.
PaTH Attention: una mejora posicional para transformadores
PaTH Attention es la nueva técnica de codificación posicional desarrollada por investigadores del MIT y el MIT‑IBM Watson AI Lab para que los transformadores sigan cambios de estado y razonamiento secuencial con mayor precisión.

Por qué importa PaTH Attention
La codificación posicional es crítica para los modelos de lenguaje grande (LLMs). RoPE, la técnica dominante, solo codifica distancia relativa entre tokens y es estática.
PaTH Attention, en cambio, hace la posición dependiente del contexto: convierte el camino entre palabras en una serie de transformaciones afectadas por el contenido de cada token.
Problema que resuelve
- Limitaciones de seguimiento de estado en transformadores.
- Dificultad para modelar cómo cambian entidades y relaciones a lo largo de secuencias largas.
- Ineficacia de codificaciones posicionales estáticas en tareas de razonamiento y contexto largo.
Cómo funciona (resumen técnico accesible)
En lugar de una rotación fija por distancia, PaTH trata las palabras intermedias como transformaciones sucesivas.
- Cada paso aplica una reflexión de Householder: una operación tipo "espejo" que depende del token.
- Las reflexiones se acumulan: el significado evoluciona según el "camino" entre tokens.
- El enfoque crea una "memoria posicional": el modelo mantiene cómo cambian las entidades y relaciones.
Optimización en hardware
El equipo diseñó un algoritmo que factoriza la transformación acumulativa en cálculos más pequeños, optimizados para GPUs.
Pro tip: PaTH Attention combina expresividad posicional dependiente de datos con eficiencia computacional compatible con entrenamiento de LLMs.
Resultados y validación
Los autores evaluaron PaTH en pruebas sintéticas y del mundo real: razonamiento, contexto largo y entrenamiento de modelos de tamaño medio.
Principales hallazgos:
| Métrica / Prueba |
Rendimiento de PaTH |
Comparación con RoPE |
| Perplexidad |
Mejora significativa |
Mejor que métodos estándar |
| Razonamiento no entrenado |
Supera a otros métodos |
Ventaja clara |
| Contextos largos (decenas de miles de tokens) |
Consistente y consciente del contenido |
Más estable |
Extensiones: PaTH-FoX y olvido selectivo
Los investigadores integraron PaTH con Forgetting Transformer (FoX) para permitir olvido dependiente de datos.
- PaTH-FoX reduce el peso de información menos relevante.
- Mejora rendimiento en razonamiento y modelado de contextos largos.
Implicaciones y aplicaciones
PaTH amplía la expresividad de los transformadores sin sacrificar escalabilidad.
- Aplicable en NLP, razonamiento secuencial y tareas con estado.
- Potencial para dominios estructurados: biología (proteínas, ADN) y código.
- Compatible con entrenamientos a escala y despliegue en GPUs.
Financiación y autores
Trabajo apoyado por MIT‑IBM Watson AI Lab y AI2050 (Schmidt Sciences).
Autor principal: Yoon Kim (MIT EECS). Coautores: Songlin Yang, Kaiyue Wen, Liliang Ren, Yikang Shen, Shawn Tan, Mayank Mishra y Rameswar Panda.
Fuente y presentación
Artículo presentado en NeurIPS y liderado por investigadores del MIT y MIT‑IBM Watson AI Lab.
FAQ
¿Qué diferencia clave tiene PaTH frente a RoPE?
RoPE codifica distancia relativa de forma fija; PaTH hace la codificación posicional dependiente del contenido y acumulativa.
¿Mejora PaTH la eficiencia?
Sí: incluye una factorización algorítmica optimizada para GPUs que mantiene la escalabilidad.
¿Dónde puede aplicarse PaTH?
En tareas de razonamiento, seguimiento de estado, contexto largo y dominios estructurados como biología y análisis de código.
Comentarios
Sin comentarios
Agregar Comentario