ZhiPu와 TileRT, 초당 400 토큰 처리 속도의 GLM-5.1 고속 API 출시… 세계 신기록 수립
Zhipu는 오늘 일부 기업 고객을 대상으로 GLM-5.1 고속 API(GLM-5.1-highspeed) 를 공식 출시했습니다. 이 모델은 초당 400 토큰이라는 놀라운 출력 속도를 달성하며, 대형 모델 API 분야의 기존 세계 속도 기록을 경신했습니다.
이는 “고성능 모델은 높은 지연 시간을 수반한다”거나 “빠른 모델은 필연적으로 경량화되어야 한다”는 업계의 오랜 통념에 도전장을 내민 것입니다. GLM-5.1 Highspeed 버전은 국내 최초로 생산 환경에서 프리미엄 모델 성능과 초저지연성을 동시에 제공하는 대규모 모델로, 사용자들이 속도를 위해 모델 품질을 희생해야 하는 부담에서 해방시켜 줍니다.

속도가 중요한 시나리오에서 사용자 경험 혁신
장거리 작업 및 복잡한 생산 환경에서 이러한 속도 향상은 제품 설계 방식을 근본적으로 변화시켰습니다:
AI 프로그래밍(코딩 에이전트): GLM-5.1의 강력한 기능을 활용하는 이 새로운 모델은 쿼리에 대한 즉각적인 답변을 제공합니다. 엔지니어링 맥락을 이해하면서 지속적으로 코드를 생성하고 솔루션을 개선합니다. 수십 번의 호출이 필요한 재구성 프로젝트에서, 몇 분에 달하는 누적 대기 시간을 없애줍니다.
실시간 동적 모델링: 3D 지도 현장 테스트에서 플레이어가 캐릭터의 움직임을 제어하고 텍스트를 입력하면, 모델이 즉시 모델링을 완료하며 장면을 실시간으로 동적으로 업데이트합니다.
에이전트 스웜 병렬 스케줄링: 장거리 작업에서 이 모델은 30초 이내에 복잡한 웹 페이지를 처리하고, 50개의 서로 다른 개성을 가진 에이전트가 병렬로 응답하도록 즉시 스케줄링하여 새로운 운영 체제의 프로토타입을 선보입니다.
핵심 기술 심층 분석: TileRT 고성능 추론 엔진
400 TPS의 안정적인 생산급 처리량은 Zhipu GLM 팀과 TileRT 팀이 수행한 시스템 수준의 최적화 결과입니다:
추론 엔진 계층 (TileRT 컴파일 단계 AOT 정적 스케줄링):
기존의 주류 프레임워크는 연산자(operator/kernel)를 기본 스케줄링 단위로 사용합니다. 단일 토큰 및 소량 배치 시나리오에서는 이로 인해 스케줄링, 메모리 액세스 및 동기화 오버헤드가 증폭됩니다. TileRT는 런타임 계층에서 동적 스케줄링을 완전히 제거하고, 대신 컴파일(AOT) 과정에서 전체 계산 그래프를 영구적인 GPU persistent Engine Kernel 로 정적으로 스케줄링합니다. 단일 GPU 내에서 연산, 비동기 I/O 및 통신은 타일 수준의 마이크로 태스크로 분해됩니다. 전체 추론 과정에서는 단 하나의 커널만 실행되며, 중간 결과는 전역 메모리에 다시 기록하지 않고 레지스터, 공유 메모리 및 L2 캐시를 통해 직접 전송됩니다.
스케줄링 시스템 계층:
동적 배칭, 요청 병합 및 KV 캐시 스케줄링 최적화를 통해 고동시성 시나리오에서 테일 지연 시간이 크게 감소합니다.
인프라 계층:
다중 카드 규모에서 TileRT는 Warp Specialization 개념을 단일 SM 내에서 전체 8-카드 NVL 토폴로지로 확장합니다. 서로 다른 GPU 랭크는 계산 밀도와 데이터 종속성에 따라 서로 다른 워커로 전문화되며, 네트워크 링크 및 부하 분산과 결합되어 협업 최적화를 통해 고성능 및 안정적인 작동을 보장합니다.
가용성 및 이용
GLM-5.1 고속 버전은 극히 낮은 응답 지연 시간을 요구하는 AI 프로그래밍, 실시간 상호 작용, 비즈니스 의사 결정 및 실시간 음성 애플리케이션에 이상적입니다. 이 서비스는 현재 Zhipu MaaS 플랫폼에서 공식적으로 제공되며, 선별된 기업 고객에게 개방되어 있습니다.
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (0)
0/500
Zhipu는 오늘 일부 기업 고객을 대상으로
이는 “고성능 모델은 높은 지연 시간을 수반한다”거나 “빠른 모델은 필연적으로 경량화되어야 한다”는 업계의 오랜 통념에 도전장을 내민 것입니다. GLM-5.1 Highspeed 버전은 국내 최초로 생산 환경에서 프리미엄 모델 성능과 초저지연성을 동시에 제공하는 대규모 모델로, 사용자들이 속도를 위해 모델 품질을 희생해야 하는 부담에서 해방시켜 줍니다.

속도가 중요한 시나리오에서 사용자 경험 혁신
장거리 작업 및 복잡한 생산 환경에서 이러한 속도 향상은 제품 설계 방식을 근본적으로 변화시켰습니다:
AI 프로그래밍(코딩 에이전트): GLM-5.1의 강력한 기능을 활용하는 이 새로운 모델은 쿼리에 대한 즉각적인 답변을 제공합니다. 엔지니어링 맥락을 이해하면서 지속적으로 코드를 생성하고 솔루션을 개선합니다. 수십 번의 호출이 필요한 재구성 프로젝트에서, 몇 분에 달하는 누적 대기 시간을 없애줍니다.
실시간 동적 모델링: 3D 지도 현장 테스트에서 플레이어가 캐릭터의 움직임을 제어하고 텍스트를 입력하면, 모델이 즉시 모델링을 완료하며 장면을 실시간으로 동적으로 업데이트합니다.
에이전트 스웜 병렬 스케줄링: 장거리 작업에서 이 모델은 30초 이내에 복잡한 웹 페이지를 처리하고, 50개의 서로 다른 개성을 가진 에이전트가 병렬로 응답하도록 즉시 스케줄링하여 새로운 운영 체제의 프로토타입을 선보입니다.
핵심 기술 심층 분석: TileRT 고성능 추론 엔진
400 TPS의 안정적인 생산급 처리량은 Zhipu GLM 팀과 TileRT 팀이 수행한 시스템 수준의 최적화 결과입니다:
추론 엔진 계층 (TileRT 컴파일 단계 AOT 정적 스케줄링):
기존의 주류 프레임워크는 연산자(operator/kernel)를 기본 스케줄링 단위로 사용합니다. 단일 토큰 및 소량 배치 시나리오에서는 이로 인해 스케줄링, 메모리 액세스 및 동기화 오버헤드가 증폭됩니다. TileRT는 런타임 계층에서 동적 스케줄링을 완전히 제거하고, 대신 컴파일(AOT) 과정에서 전체 계산 그래프를 영구적인 GPU persistent Engine Kernel 로 정적으로 스케줄링합니다. 단일 GPU 내에서 연산, 비동기 I/O 및 통신은 타일 수준의 마이크로 태스크로 분해됩니다. 전체 추론 과정에서는 단 하나의 커널만 실행되며, 중간 결과는 전역 메모리에 다시 기록하지 않고 레지스터, 공유 메모리 및 L2 캐시를 통해 직접 전송됩니다.
스케줄링 시스템 계층:
동적 배칭, 요청 병합 및 KV 캐시 스케줄링 최적화를 통해 고동시성 시나리오에서 테일 지연 시간이 크게 감소합니다.
인프라 계층:
다중 카드 규모에서 TileRT는 Warp Specialization 개념을 단일 SM 내에서 전체 8-카드 NVL 토폴로지로 확장합니다. 서로 다른 GPU 랭크는 계산 밀도와 데이터 종속성에 따라 서로 다른 워커로 전문화되며, 네트워크 링크 및 부하 분산과 결합되어 협업 최적화를 통해 고성능 및 안정적인 작동을 보장합니다.
가용성 및 이용
GLM-5.1 고속 버전은 극히 낮은 응답 지연 시간을 요구하는 AI 프로그래밍, 실시간 상호 작용, 비즈니스 의사 결정 및 실시간 음성 애플리케이션에 이상적입니다. 이 서비스는 현재
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






