Hogar
Bailing Team se asocia con AReno para crear un ciclo de aprendizaje por refuerzo con un agente de IA local
La capacidad de implementación local no garantiza una gestión fluida de los escenarios empresariales del mundo real. En flujos de trabajo complejos, la IA debe ir más allá de la simple conversación; debe interpretar reglas complejas, respetar las restricciones de seguridad e invocar herramientas externas con precisión para generar resultados que cumplan con los requisitos. Para resolver este reto, el equipo de Ant ASystem y la comunidad de código abierto han desarrollado AReno, un conjunto de herramientas para el posentrenamiento de grandes modelos a nivel local. Recientemente, AReno se ha integrado con el gran modelo BaiLing para establecer un flujo de trabajo de posentrenamiento ligero, creando con éxito un bucle de aprendizaje por refuerzo (RL) agéntico en una configuración de una sola máquina.
Para garantizar la reproducibilidad técnica, se seleccionó el «Tic-Tac-Toe» como tarea de validación debido a sus reglas claras y a su retroalimentación inmediata. El experimento se ejecutó en hardware DGX Spark, realizando el posentrenamiento en el modelo Ling-3.0-tiny (7.9 mil millones de parámetros totales, 1.3 mil millones activos). Inicialmente, el modelo comprendía las reglas básicas, pero realizaba jugadas ilegales. Al convertir las reglas de la tarea en un mecanismo preciso de retroalimentación de recompensas y entrenar durante 400 pasos utilizando el algoritmo GSPO, la recompensa media del modelo se disparó y la longitud de la salida se estabilizó. Las pruebas posteriores confirmaron un salto cualitativo en la estabilidad y la racionalidad del modelo en lo que respecta a la invocación de herramientas y la selección de acciones.

Esta investigación valida una metodología de adaptación de tareas transparente y reproducible: identificar errores, definir una retroalimentación verificable y llevar a cabo el entrenamiento local y nuevas pruebas en el mismo entorno. Este marco va más allá de los experimentos con el ajedrez y se aplica a la perfección a escenarios de producción del mundo real, como la reparación mediante llamada a herramientas, la extracción de campos estructurados, el seguimiento de instrucciones específicas de cada dominio y los agentes inteligentes en procesos empresariales.
Ling-3.0-tiny está disponible en varias versiones de código abierto, entre las que se incluyen BF16, FP8 e INT4. Los desarrolladores pueden acceder a estos modelos a través de Hugging Face o de la comunidad Moka. Además, el repositorio de código abierto AReno está disponible para la aportación de código y el debate técnico.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (2)
0/500
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。
La capacidad de implementación local no garantiza una gestión fluida de los escenarios empresariales del mundo real. En flujos de trabajo complejos, la IA debe ir más allá de la simple conversación; debe interpretar reglas complejas, respetar las restricciones de seguridad e invocar herramientas externas con precisión para generar resultados que cumplan con los requisitos. Para resolver este reto, el equipo de Ant ASystem y la comunidad de código abierto han desarrollado AReno, un conjunto de herramientas para el posentrenamiento de grandes modelos a nivel local. Recientemente, AReno se ha integrado con el gran modelo BaiLing para establecer un flujo de trabajo de posentrenamiento ligero, creando con éxito un bucle de aprendizaje por refuerzo (RL) agéntico en una configuración de una sola máquina.
Para garantizar la reproducibilidad técnica, se seleccionó el «Tic-Tac-Toe» como tarea de validación debido a sus reglas claras y a su retroalimentación inmediata. El experimento se ejecutó en hardware DGX Spark, realizando el posentrenamiento en el modelo Ling-3.0-tiny (7.9 mil millones de parámetros totales, 1.3 mil millones activos). Inicialmente, el modelo comprendía las reglas básicas, pero realizaba jugadas ilegales. Al convertir las reglas de la tarea en un mecanismo preciso de retroalimentación de recompensas y entrenar durante 400 pasos utilizando el algoritmo GSPO, la recompensa media del modelo se disparó y la longitud de la salida se estabilizó. Las pruebas posteriores confirmaron un salto cualitativo en la estabilidad y la racionalidad del modelo en lo que respecta a la invocación de herramientas y la selección de acciones.

Esta investigación valida una metodología de adaptación de tareas transparente y reproducible: identificar errores, definir una retroalimentación verificable y llevar a cabo el entrenamiento local y nuevas pruebas en el mismo entorno. Este marco va más allá de los experimentos con el ajedrez y se aplica a la perfección a escenarios de producción del mundo real, como la reparación mediante llamada a herramientas, la extracción de campos estructurados, el seguimiento de instrucciones específicas de cada dominio y los agentes inteligentes en procesos empresariales.
Ling-3.0-tiny está disponible en varias versiones de código abierto, entre las que se incluyen BF16, FP8 e INT4. Los desarrolladores pueden acceder a estos modelos a través de Hugging Face o de la comunidad Moka. Además, el repositorio de código abierto AReno está disponible para la aportación de código y el debate técnico.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。











