¿Es siempre mejor el aprendizaje On-Policy? Desmitificando el entrenamiento de modelos de IA
¿Es siempre mejor el aprendizaje On-Policy? Desmitificando el entrenamiento de modelos de IA
En el mundo del desarrollo de la Inteligencia Artificial, existe un dogma ampliamente aceptado: para que un modelo aprenda de forma óptima, debe generar sus propios datos durante el entrenamiento, un proceso conocido como aprendizaje "on-policy". La teoría sugiere que esto reduce el olvido de conocimientos previos y mejora la capacidad de generalización. Sin embargo, una investigación reciente de la Universidad de Cambridge y el Instituto Alan Turing pone en duda esta premisa, ofreciendo lecciones valiosas para las empresas que buscan optimizar sus procesos de entrenamiento de modelos de lenguaje (LLM).
El experimento: Aislando el valor de los datos
El equipo de investigación, liderado por Julianna Piskorz, diseñó un entorno controlado para separar los efectos de la política de generación de datos (quién genera la respuesta) de otros factores como la tasa de aprendizaje y el objetivo matemático. Utilizando familias de modelos potentes como Llama 3 y Qwen 2.5 en tareas de razonamiento científico, médico y aritmético, descubrieron que la superioridad del aprendizaje "on-policy" no es universal. En muchos casos, utilizar datos generados por un modelo "maestro" (off-policy) es igual de efectivo, lo que podría simplificar drásticamente las infraestructuras de entrenamiento para muchas organizaciones.
La clave está en la función de pérdida, no en el origen
Uno de los hallazgos más relevantes para los profesionales del sector es que la dirección de la Divergencia de Kullback-Leibler (KL) —la métrica que mide la diferencia entre la distribución del maestro y el alumno— es mucho más influyente que el origen de los datos. El estudio demuestra que la configuración de "Forward KL" es extremadamente robusta y mantiene un alto rendimiento independientemente de si los datos son propios o externos. Por el contrario, la "Reverse KL" es mucho más sensible y sí parece beneficiarse de los datos generados por el propio modelo. Para una empresa, esto significa que elegir el objetivo matemático correcto puede ser más importante que invertir en complejos sistemas de generación de datos en tiempo real.
Implicaciones prácticas: Estilo vs. Rendimiento
El estudio también exploró la transferencia de estilo, utilizando un experimento donde un maestro hablaba en español mientras resolvía problemas científicos. Los resultados mostraron que el aprendizaje on-policy con Reverse KL es el más resistente a adoptar "vicios" o estilos incidentales del maestro, enfocándose solo en la precisión de la tarea. Si su objetivo es destilar el conocimiento de un modelo grande a uno pequeño sin heredar su tono o muletillas, la combinación de datos propios y Reverse KL es la ganadora. Si busca estabilidad y facilidad de implementación, Forward KL es la opción más segura.
¿Qué significa esto para su estrategia de IA?
Para los líderes tecnológicos y de negocios, la conclusión es clara: no existe una receta única. El valor de los datos propios (on-policy) depende críticamente del objetivo final y de la configuración del sistema. Antes de comprometer recursos masivos en arquitecturas de aprendizaje por refuerzo complejas, las empresas deben evaluar si un enfoque de destilación más sencillo y tradicional (off-policy) podría ofrecer resultados similares con una fracción del costo y la complejidad técnica. La eficiencia en IA hoy no se trata de seguir dogmas, sino de entender qué palancas matemáticas realmente mueven la aguja del rendimiento.


