Bailing Team, AReno와 협력해 지역 기반 AI 에이전트 강화 학습 루프 구축
온프레미스 배포 기능만으로는 실제 비즈니스 시나리오를 원활하게 처리할 수 있다는 보장이 없습니다. 복잡한 워크플로우에서 AI는 단순히 대화를 나누는 것 이상의 역할을 수행해야 합니다. 즉, 복잡한 규칙을 해석하고, 보안 제약 사항을 준수하며, 외부 도구를 정확하게 호출하여 규정 준수 요건을 충족하는 결과를 생성해야 합니다. 이러한 과제를 해결하기 위해 Ant ASystem 팀과 오픈소스 커뮤니티는 로컬 대규모 모델 사후 학습 툴킷인 ‘AReno’를 개발했습니다. 최근 AReno는 BaiLing 대규모 모델과 통합되어 경량 사후 학습 워크플로를 구축했으며, 단일 시스템 환경 내에서 에이전트 기반 강화 학습(RL) 루프를 성공적으로 구축했습니다.
기술적 재현성을 보장하기 위해, 규칙이 명확하고 즉각적인 피드백을 제공하는 티크택토(Tic-Tac-Toe)를 검증 과제로 선정했습니다. 실험은 DGX Spark 하드웨어에서 수행되었으며, Ling-3.0-tiny 모델(총 매개변수 7.9B, 활성 매개변수 1.3B)에 대한 사후 훈련을 진행했습니다. 초기에는 모델이 기본 규칙을 이해했으나 불법적인 수를 두었습니다. 작업 규칙을 정밀한 보상 피드백 메커니즘으로 변환하고 GSPO 알고리즘을 사용하여 400단계 동안 훈련한 결과, 모델의 평균 보상이 급증했고 출력 길이가 안정화되었습니다. 후속 테스트를 통해 도구 호출 및 행동 선택과 관련하여 모델의 안정성과 합리성이 질적으로 도약했음이 확인되었습니다.

이번 연구는 오류 식별, 검증 가능한 피드백 정의, 동일한 환경에서의 국소적 훈련 및 재테스트 실행이라는 투명하고 재현 가능한 과제 적응 방법론을 입증합니다. 이 프레임워크는 체스 실험을 넘어 도구 호출 수정, 구조화된 필드 추출, 도메인별 지시 사항 이행, 비즈니스 프로세스 내 지능형 에이전트와 같은 실제 생산 시나리오에 원활하게 적용됩니다.
Ling-3.0-tiny는 BF16, FP8, INT4를 포함한 여러 오픈소스 버전으로 제공됩니다. 개발자는 Hugging Face 또는 Moka 커뮤니티를 통해 이러한 모델에 접근할 수 있습니다. 또한, 코드 기여 및 기술적 토론을 위해 AReno 오픈소스 저장소를 이용할 수 있습니다.
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (2)
0/500
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。
온프레미스 배포 기능만으로는 실제 비즈니스 시나리오를 원활하게 처리할 수 있다는 보장이 없습니다. 복잡한 워크플로우에서 AI는 단순히 대화를 나누는 것 이상의 역할을 수행해야 합니다. 즉, 복잡한 규칙을 해석하고, 보안 제약 사항을 준수하며, 외부 도구를 정확하게 호출하여 규정 준수 요건을 충족하는 결과를 생성해야 합니다. 이러한 과제를 해결하기 위해 Ant ASystem 팀과 오픈소스 커뮤니티는 로컬 대규모 모델 사후 학습 툴킷인 ‘AReno’를 개발했습니다. 최근 AReno는 BaiLing 대규모 모델과 통합되어 경량 사후 학습 워크플로를 구축했으며, 단일 시스템 환경 내에서 에이전트 기반 강화 학습(RL) 루프를 성공적으로 구축했습니다.
기술적 재현성을 보장하기 위해, 규칙이 명확하고 즉각적인 피드백을 제공하는 티크택토(Tic-Tac-Toe)를 검증 과제로 선정했습니다. 실험은 DGX Spark 하드웨어에서 수행되었으며, Ling-3.0-tiny 모델(총 매개변수 7.9B, 활성 매개변수 1.3B)에 대한 사후 훈련을 진행했습니다. 초기에는 모델이 기본 규칙을 이해했으나 불법적인 수를 두었습니다. 작업 규칙을 정밀한 보상 피드백 메커니즘으로 변환하고 GSPO 알고리즘을 사용하여 400단계 동안 훈련한 결과, 모델의 평균 보상이 급증했고 출력 길이가 안정화되었습니다. 후속 테스트를 통해 도구 호출 및 행동 선택과 관련하여 모델의 안정성과 합리성이 질적으로 도약했음이 확인되었습니다.

이번 연구는 오류 식별, 검증 가능한 피드백 정의, 동일한 환경에서의 국소적 훈련 및 재테스트 실행이라는 투명하고 재현 가능한 과제 적응 방법론을 입증합니다. 이 프레임워크는 체스 실험을 넘어 도구 호출 수정, 구조화된 필드 추출, 도메인별 지시 사항 이행, 비즈니스 프로세스 내 지능형 에이전트와 같은 실제 생산 시나리오에 원활하게 적용됩니다.
Ling-3.0-tiny는 BF16, FP8, INT4를 포함한 여러 오픈소스 버전으로 제공됩니다. 개발자는 Hugging Face 또는 Moka 커뮤니티를 통해 이러한 모델에 접근할 수 있습니다. 또한, 코드 기여 및 기술적 토론을 위해 AReno 오픈소스 저장소를 이용할 수 있습니다.
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。





집






