Atención sin softmax: el experimento que cuestiona los LLMs

Un modelo open-source desafía la arquitectura estándar de los transformers. Además: herramientas prácticas para builders y datos sucios en series de tiempo.

Lo más importante de hoy en IA

Un domingo inusualmente técnico: las noticias que dominan hoy vienen de la comunidad open-source, no de los laboratorios grandes. El tema central es arquitectónico — alguien acaba de publicar un modelo que elimina una de las piezas más fundamentales de los transformers modernos. Al mismo tiempo, resurge el interés por hacer la IA más accesible para quien quiere construir, no solo consumir. Un día para developers curiosos.

Un modelo sin softmax: ¿se puede tirar una pieza fundamental del transformer?

Desde que los transformers se convirtieron en la arquitectura dominante de la IA, la función softmax ha sido una pieza inamovible del mecanismo de atención. Calcula cuánto “peso” le da el modelo a cada token cuando procesa una secuencia. Nadie la cuestionaba demasiado — funcionaba, y punto. Esa lógica acaba de recibir un empujón serio: un investigador independiente bajo el alias NonGameCatharsis publicó esta semana un modelo de 354 millones de parámetros entrenado con 11.5 mil millones de tokens que reemplaza el softmax con dispersión estructural (structural sparsity) y kernels personalizados de Triton para saltar bloques de cómputo innecesarios.

El resultado práctico más inmediato es el ahorro de VRAM en contextos largos. Uno de los cuellos de botella reales cuando se trabaja con ventanas de contexto extendidas no es solo el tiempo de cómputo — es la memoria en GPU. La atención estándar tiene un costo cuadrático en memoria respecto a la longitud del contexto. El tile-skipping que propone este modelo ataca exactamente ese punto: en lugar de calcular atención sobre todos los pares de tokens, identifica y omite los bloques que contribuyen poco al resultado final.

Los pesos están disponibles públicamente junto con el código de los kernels Triton. Esto no es una investigación de laboratorio cerrado — cualquier equipo puede descargar el modelo hoy mismo y reproducir los experimentos. A esta escala (GPT-2 Medium), las conclusiones no se pueden extrapolar directamente a modelos de miles de millones de parámetros, pero el precedente es valioso: demuestra que la arquitectura de atención tiene más espacio de exploración del que el consenso del mercado sugiere.

Para equipos que trabajan con documentos largos, RAG sobre bases de conocimiento extensas o cualquier aplicación donde el contexto sea un recurso escaso, vale la pena seguir este trabajo de cerca. Si las técnicas escalan, podrían traducirse en inferencia más barata sin sacrificar calidad.

Construir un LLM desde cero: un recurso para quienes aprenden haciendo

Mientras los papers avanzan, la brecha entre “entender conceptualmente los LLMs” y “saber construir uno” sigue siendo enorme para la mayoría de los profesionales de tecnología. Esta semana apareció en YouTube un workshop completo titulado “Build Your Own LLM” que intenta cerrar esa brecha con un enfoque poco común: no exige conocimientos de matemáticas ni de machine learning como punto de partida.

El material cubre el camino completo — desde perceptrones y funciones de activación (ReLU, GELU, SwiGLU) hasta la arquitectura transformer, pasando por entrenamiento y post-entrenamiento. Lo que lo distingue de otros recursos similares es el método de enseñanza: usa código ejecutable y ejemplos en Excel para construir intuición antes de introducir formalismo. Para un product manager o un developer que trabaja con APIs de IA pero nunca ha tocado PyTorch, ese punto de entrada cambia completamente la accesibilidad.

No es un recurso para quien quiere hacer investigación de punta. Es para quien quiere dejar de tratar los LLMs como cajas negras y empezar a razonar sobre sus limitaciones, sus sesgos y sus posibilidades con más precisión. En un mercado donde cada semana aparece un modelo nuevo con claims difíciles de evaluar, ese tipo de comprensión arquitectónica tiene valor directo en decisiones de producto y de ingeniería.

Datos sucios en series de tiempo: el problema silencioso que arruina modelos

Una historia más cercana al trabajo cotidiano de los equipos de datos: un developer publicó TSAuditor, un framework de auditoría para series de tiempo, después de quemarse con un problema clásico. Tenía diez años de datos históricos, su herramienta de profiling reportó un 3% de datos faltantes — dentro de lo tolerable —, y sin embargo los modelos downstream se comportaban mal. El problema real no era la cantidad de datos faltantes sino su distribución temporal: los huecos estaban concentrados en períodos específicos, lo que creaba patrones artificiales que el modelo aprendía como si fueran señal real.

Este tipo de error es especialmente traicionero en series de tiempo porque las herramientas de validación genéricas no están diseñadas para detectar dependencias temporales. Un 3% de missings distribuidos aleatoriamente es ruido manejable. El mismo 3% concentrado en los lunes de un año específico puede ser una anomalía operacional que contamina cualquier modelo de forecasting.

TSAuditor apunta a hacer visible exactamente ese tipo de problema antes de que llegue a producción. Para equipos que trabajan con datos financieros, de operaciones, de demanda o cualquier señal con estructura temporal, la herramienta merece una revisión. El costo de detectar estos problemas tarde — después de que un modelo de forecasting lleva semanas en producción — es considerablemente mayor que auditarlo bien desde el inicio.

En pocas palabras

Lo que une las noticias de hoy es un patrón que se repite cada vez con más fuerza en 2026: el avance real no siempre viene de los laboratorios con más cómputo. Viene de personas que se hacen preguntas incómodas sobre piezas que “siempre funcionaron así” — como el softmax —, o que resuelven problemas concretos que las herramientas grandes ignoran porque son demasiado específicos. La comunidad open-source está operando con una velocidad y una honestidad sobre las limitaciones que los lanzamientos corporativos rara vez tienen. Para los profesionales que toman decisiones sobre qué tecnología adoptar, eso es cada vez más relevante: el mapa del territorio ya no lo dibujan solo las empresas grandes.


Fuentes utilizadas: https://www.reddit.com/r/MachineLearning/comments/1ubmybr/i_released_a_softmaxfree_attention_model_at_gpt2/, https://www.reddit.com/r/MachineLearning/comments/1uazlnd/hi_reddit_i_posted_my_build_your_own_llm_workshop/, https://www.reddit.com/r/MachineLearning/comments/1ub15wf/tsauditor_a_timeseries_auditing_framework_p/