Investigación · arquitecturas de lenguaje
Dalton
Arquitectura Mixture of Experts con atención latente multi-cabeza, orientada a inferencia más eficiente.
Problema
Escalar modelos de lenguaje con atención densa se vuelve caro en memoria y cómputo. Hace falta explorar arquitecturas que activen expertos de forma selectiva.
Enfoque
Implementación de DaltonMoE: Mixture of Experts combinado con Multi-Head Latent Attention, RMSNorm y RoPE — investigación de arquitectura, no un producto empaquetado.
Resultado
Código de investigación de la arquitectura (MoE + atención latente). Sirve como base experimental; no reportamos benchmarks públicos inventados.
Stack
PyTorch · MoE · Multi-Head Latent Attention · RoPE
