¿Los LLMs razonan o solo reconocen patrones matemáticos?
Un modelo de 4M parámetros alcanza 98.6% en matemática simbólica. Lo que eso revela sobre cómo 'piensa' la IA.
Lo más importante de hoy en IA
Un domingo más tranquilo en términos de lanzamientos corporativos, pero denso en investigación comunitaria. Lo que domina la conversación hoy son preguntas fundamentales: ¿la IA realmente razona o solo es muy buena imitando estructuras? ¿Tiene sentido seguir estudiando algoritmos cuando los modelos ya escriben código? Y en el lado más técnico, algunos proyectos interesantes que resuelven problemas prácticos de infraestructura. Tres temas que, mirados juntos, dicen bastante sobre el momento en que estamos.
MathFormer: un modelo diminuto que destruye el argumento del “razonamiento matemático”
Un experimento publicado esta semana en r/MachineLearning pone en jaque una de las narrativas más repetidas sobre los grandes modelos de lenguaje: que han aprendido a razonar matemáticamente. El proyecto se llama MathFormer y el hallazgo es incómodo para quienes defienden las capacidades cognitivas de los LLMs.
El experimento es simple pero elegante. Un modelo seq2seq de apenas 4 millones de parámetros —una fracción microscópica de lo que es GPT-4 o Claude— fue entrenado sin ningún conocimiento matemático explícito. Su tarea: dada una expresión factorizada como (7-3*z)*(-5*z-9), predecir la forma expandida. El modelo alcanzó 98.6% de precisión. No porque “entienda” álgebra, sino porque aprendió transformaciones estructurales de tokens: patrones en la forma de las expresiones, no en su significado.
La implicación es directa. Si un modelo de 4M parámetros sin conocimiento matemático puede resolver simbólica con casi perfección, hay razones serias para dudar de que los LLMs más grandes estén “razonando” cuando resuelven problemas de matemáticas. Es más probable que estén ejecutando transformaciones de patrones a una escala masiva. Esto no los hace menos útiles en la práctica, pero sí debería calibrar las expectativas de quienes los usan para tareas que requieren razonamiento genuino en dominios nuevos o fuera de distribución. Si le pides a un modelo que resuelva un tipo de problema que nunca ha visto en una forma estructuralmente similar, la confianza debería bajar considerablemente.
¿Hay que seguir estudiando algoritmos? La comunidad ML debate con más profundidad de lo esperado
La pregunta “¿todavía vale la pena estudiar algoritmos ahora que la IA escribe código?” circula en foros desde hace meses, pero el hilo que abrió esta semana en r/MachineLearning generó una discusión más matizada de lo habitual —y útil para cualquier developer o tech lead que esté tomando decisiones de contratación o de desarrollo de carrera.
El argumento a favor de soltar los algoritmos es conocido: los modelos actuales generan código funcional, refactorizan proyectos, explican complejidad algorítmica y resuelven muchos problemas mejor que un junior. Stack Overflow, según varios participantes del hilo, está en declive visible porque la gente simplemente pregunta a la IA. ¿Para qué memorizar árboles rojo-negro si el modelo los implementa en segundos?
El contraargumento que emerge con más fuerza no es nostálgico sino pragmático: sin entender algoritmos, no puedes evaluar si el código que genera la IA es correcto, eficiente o adecuado para tu caso de uso. La IA comete errores que son invisibles para quien no tiene el criterio para detectarlos. Un developer que no entiende complejidad computacional no puede saber cuándo el modelo eligió la solución incorrecta para un problema de escala. Lo que cambia no es si estudiar algoritmos, sino para qué: menos memorización de implementaciones, más comprensión de trade-offs y criterio de evaluación.
Picotron: entrenar LLMs en GPUs viejas sin que todo explote en el import
En el lado más práctico del día, un developer publicó Picotron, un framework de entrenamiento de LLMs escrito desde cero para resolver un problema concreto: Nanotron, el framework popular, importa dependencias como flash-attn, triton y functorch a nivel de módulo, lo que hace que el proceso explote inmediatamente si corres en hardware más antiguo como una T4 o una V100.
Picotron elimina esas dependencias obligatorias. Corre en prácticamente cualquier GPU que soporte PyTorch, lo que lo hace relevante para equipos que trabajan con infraestructura de nube más económica, universidades, startups en etapa temprana o cualquiera que no quiera o no pueda pagar por las últimas A100 o H100. El repositorio está disponible en GitHub bajo Syntropy-AI-Labs.
Para equipos latinoamericanos que experimentan con fine-tuning o entrenamiento propio y que no tienen acceso fácil a hardware de última generación, este tipo de herramienta tiene valor real. La barrera de entrada al entrenamiento de modelos propios sigue siendo alta, y proyectos como este empujan esa barrera un poco hacia abajo sin sacrificar la funcionalidad central.
En pocas palabras
Lo que conecta las tres noticias de hoy es una misma tensión: la brecha entre lo que la IA parece hacer y lo que realmente hace. MathFormer sugiere que el “razonamiento” puede ser sofisticado reconocimiento de patrones. El debate sobre algoritmos muestra que delegar a la IA sin criterio propio es una trampa. Y Picotron existe porque las herramientas asumen hardware que la mayoría no tiene. El ecosistema de IA madura, pero sigue siendo territorio de quienes entienden qué hay debajo del capó —no solo quienes saben pedirle cosas al modelo.
Fuentes utilizadas: MathFormer en Reddit MachineLearning (https://www.reddit.com/r/MachineLearning/comments/1uhatw8/mathformer_testing_whether_symbolic_math_is/), debate sobre algoritmos en Reddit MachineLearning (https://www.reddit.com/r/MachineLearning/comments/1uhdydj/do_we_still_need_to_study_algorithms_now_that_ai/), Picotron en Reddit MachineLearning (https://www.reddit.com/r/MachineLearning/comments/1uh7ib3/built_an_llm_training_framework_that_actually_runs/)