La startup china de inteligencia artificial DeepSeek ha captado la atención del mundo tecnológico al superar a ChatGPT en la App Store.
Sin embargo, más allá de su éxito comercial, la empresa ha enfrentado desafíos significativos, como un ataque a su sitio web que obligó a suspender nuevos registros. Además, surgieron dudas sobre el uso de chips Nvidia H100, sujetos a restricciones de exportación, en lugar de los H800 que afirmaba emplear, lo que generó preocupaciones sobre el cumplimiento normativo y la eficiencia de costos.
Un avance reciente de investigadores de la Universidad de California, Berkeley, liderado por el candidato a doctorado Jiayi Pan, está desafiando estas suposiciones. El equipo logró replicar las capacidades centrales del modelo DeepSeek R1-Zero por menos de $30, un costo inferior al de una salida nocturna. Este logro podría marcar el inicio de una nueva era en la revolución de los modelos pequeños de aprendizaje por refuerzo.
Recreación de DeepSeek R1 por solo $30
El equipo de Berkeley trabajó con un modelo de lenguaje de 3 mil millones de parámetros de DeepSeek, entrenándolo mediante aprendizaje por refuerzo para desarrollar habilidades de autoverificación y búsqueda. El objetivo era resolver desafíos aritméticos alcanzando un número objetivo, un experimento que completaron por solo $30. En comparación, las API o1 de OpenAI cuestan $15 por millón de tokens de entrada, más de 27 veces el precio de DeepSeek-R1, que opera a solo $0.55 por millón de tokens.
Pan ve este proyecto como un paso hacia la reducción de barreras en la investigación de escalado de aprendizaje por refuerzo, especialmente dado su costo mínimo. No obstante, no todos están convencidos. El experto en aprendizaje automático Nathan Lambert cuestiona la afirmación de DeepSeek de que entrenar su modelo de 671 mil millones de parámetros solo cuesta $5 millones, sugiriendo que la cifra probablemente excluye gastos clave como personal de investigación, infraestructura y electricidad.
Modelos pequeños, impacto grande
Según un post de Jiayi Pan, el equipo reprodujo con éxito DeepSeek R1-Zero utilizando un modelo de lenguaje pequeño. Aplicando aprendizaje por refuerzo en el juego Countdown, el modelo desarrolló estrategias de autoverificación y búsqueda, habilidades clave en sistemas de inteligencia artificial avanzados.
Los hallazgos clave incluyen:
- Replicación exitosa de los métodos de DeepSeek R1-Zero por menos de $30.
- Modelo de 1.5 mil millones de parámetros demostrando habilidades de razonamiento avanzado.
- Rendimiento equiparable a sistemas de inteligencia artificial más grandes.
Avances en aprendizaje por refuerzo
Los investigadores comenzaron con un modelo de lenguaje base, un indicador estructurado y una recompensa de verdad absoluta. Luego introdujeron el aprendizaje por refuerzo mediante Countdown, un juego lógico adaptado de un programa de televisión británico. En este desafío, los jugadores deben alcanzar un número objetivo usando operaciones aritméticas, fomentando que los modelos de inteligencia artificial refinen sus habilidades de razonamiento.
Inicialmente, la inteligencia artificial produjo respuestas aleatorias. A través de prueba y error, comenzó a verificar sus propias respuestas, ajustando su enfoque en cada iteración, similar a cómo los humanos resuelven problemas. Incluso el modelo más pequeño, de 0.5 mil millones de parámetros, solo podía hacer conjeturas simples, pero al escalar a 1.5 mil millones y más, la inteligencia artificial comenzó a exhibir un razonamiento más avanzado.
Descubrimientos sorprendentes
Uno de los hallazgos más interesantes fue cómo diferentes tareas llevaron al modelo a desarrollar técnicas de resolución de problemas específicas. En Countdown, refinó sus estrategias de búsqueda y verificación, aprendiendo a iterar y mejorar sus respuestas. Al enfrentarse a problemas de multiplicación, aplicó la ley distributiva, descomponiendo números de manera similar a como lo hacen los humanos en cálculos mentales complejos.
Otro descubrimiento notable fue que la elección del algoritmo de aprendizaje por refuerzo—ya sea PPO, GRPO o PRIME—tuvo poco impacto en el rendimiento general. Los resultados fueron consistentes en diferentes métodos, sugiriendo que el aprendizaje estructurado y el tamaño del modelo juegan un papel más importante en el desarrollo de capacidades de inteligencia artificial que el algoritmo específico utilizado.
Una inteligencia artificial más inteligente a través del aprendizaje específico
Uno de los aspectos más interesantes es cómo la inteligencia artificial se adaptó a diferentes desafíos. Para el juego Countdown, aprendió técnicas de búsqueda y autoverificación. Cuando se probó con problemas de multiplicación, los abordó de manera diferente, usando la ley distributiva para descomponer cálculos antes de resolverlos paso a paso.
En lugar de adivinar al azar, la inteligencia artificial refinó su enfoque a través de múltiples iteraciones, verificando y revisando sus respuestas hasta llegar a la solución correcta. Esto sugiere que los modelos pueden desarrollar habilidades especializadas según la tarea, en lugar de depender de un método de razonamiento único.
Un cambio en la accesibilidad de la inteligencia artificial
Con un costo total de menos de $30 y el código disponible públicamente en GitHub, esta investigación hace que la inteligencia artificial avanzada sea más accesible para desarrolladores e investigadores. Desafía la noción de que los avances revolucionarios requieren presupuestos multimillonarios, reforzando la idea de que la ingeniería inteligente puede superar el gasto masivo.
Este trabajo refleja una visión defendida durante mucho tiempo por Richard Sutton, una figura destacada en el aprendizaje por refuerzo, quien argumentó que los marcos de aprendizaje simples pueden producir resultados poderosos. Los hallazgos del equipo de Berkeley sugieren que tenía razón: las capacidades complejas de inteligencia artificial no necesariamente requieren una computación a gran escala, sino el entorno de entrenamiento adecuado.