Iniciar sesión Registro
Anuncios
Tu espacio publicitario
Reserva este slot exclusivo para el periodo elegido.
Comprar publicidad →
Inteligencia Artificial (IA)

Una nueva forma de aumentar las capacidades de los grandes modelos de lenguaje

3 min de lectura 21.12.2025

Investigadores del MIT-IBM Watson AI Lab presentan PaTH Attention, una codificación posicional adaptable que mejora el seguimiento de estados y el razonamiento secuencial en LLMs.

Imagen del artículo - Una nueva forma de aumentar las capacidades de los grandes modelos de lenguaje
Anuncios
Tu espacio publicitario
Reserva este slot exclusivo para el periodo elegido.
Comprar publicidad →

PaTH Attention: una mejora posicional para transformadores

PaTH Attention es la nueva técnica de codificación posicional desarrollada por investigadores del MIT y el MIT‑IBM Watson AI Lab para que los transformadores sigan cambios de estado y razonamiento secuencial con mayor precisión.

Una nueva forma de aumentar las capacidades de los grandes modelos de lenguaje

Por qué importa PaTH Attention

La codificación posicional es crítica para los modelos de lenguaje grande (LLMs). RoPE, la técnica dominante, solo codifica distancia relativa entre tokens y es estática.

PaTH Attention, en cambio, hace la posición dependiente del contexto: convierte el camino entre palabras en una serie de transformaciones afectadas por el contenido de cada token.

Anuncios
Tu espacio publicitario
Reserva este slot exclusivo para el periodo elegido.
Comprar publicidad →

Problema que resuelve

  • Limitaciones de seguimiento de estado en transformadores.
  • Dificultad para modelar cómo cambian entidades y relaciones a lo largo de secuencias largas.
  • Ineficacia de codificaciones posicionales estáticas en tareas de razonamiento y contexto largo.

Cómo funciona (resumen técnico accesible)

En lugar de una rotación fija por distancia, PaTH trata las palabras intermedias como transformaciones sucesivas.

  • Cada paso aplica una reflexión de Householder: una operación tipo "espejo" que depende del token.
  • Las reflexiones se acumulan: el significado evoluciona según el "camino" entre tokens.
  • El enfoque crea una "memoria posicional": el modelo mantiene cómo cambian las entidades y relaciones.

Optimización en hardware

El equipo diseñó un algoritmo que factoriza la transformación acumulativa en cálculos más pequeños, optimizados para GPUs.

Pro tip: PaTH Attention combina expresividad posicional dependiente de datos con eficiencia computacional compatible con entrenamiento de LLMs.

Resultados y validación

Los autores evaluaron PaTH en pruebas sintéticas y del mundo real: razonamiento, contexto largo y entrenamiento de modelos de tamaño medio.

Principales hallazgos:

Métrica / Prueba Rendimiento de PaTH Comparación con RoPE
Perplexidad Mejora significativa Mejor que métodos estándar
Razonamiento no entrenado Supera a otros métodos Ventaja clara
Contextos largos (decenas de miles de tokens) Consistente y consciente del contenido Más estable

Extensiones: PaTH-FoX y olvido selectivo

Los investigadores integraron PaTH con Forgetting Transformer (FoX) para permitir olvido dependiente de datos.

  • PaTH-FoX reduce el peso de información menos relevante.
  • Mejora rendimiento en razonamiento y modelado de contextos largos.

Implicaciones y aplicaciones

PaTH amplía la expresividad de los transformadores sin sacrificar escalabilidad.

  • Aplicable en NLP, razonamiento secuencial y tareas con estado.
  • Potencial para dominios estructurados: biología (proteínas, ADN) y código.
  • Compatible con entrenamientos a escala y despliegue en GPUs.

Financiación y autores

Trabajo apoyado por MIT‑IBM Watson AI Lab y AI2050 (Schmidt Sciences).

Autor principal: Yoon Kim (MIT EECS). Coautores: Songlin Yang, Kaiyue Wen, Liliang Ren, Yikang Shen, Shawn Tan, Mayank Mishra y Rameswar Panda.

Fuente y presentación

Artículo presentado en NeurIPS y liderado por investigadores del MIT y MIT‑IBM Watson AI Lab.

FAQ

¿Qué diferencia clave tiene PaTH frente a RoPE?

RoPE codifica distancia relativa de forma fija; PaTH hace la codificación posicional dependiente del contenido y acumulativa.

¿Mejora PaTH la eficiencia?

Sí: incluye una factorización algorítmica optimizada para GPUs que mantiene la escalabilidad.

¿Dónde puede aplicarse PaTH?

En tareas de razonamiento, seguimiento de estado, contexto largo y dominios estructurados como biología y análisis de código.

Compartir Facebook X Telegram

Comentarios

Sin comentarios

Agregar Comentario

0 / 2000