OpenAI, 더욱 자연스러운 실시간 대화를 위한 첨단 음성 모델 공개

OpenAI는 더 자연스러운 음성을 제공하고 대화 순서를 보다 효과적으로 관리하도록 설계된 새로운 대화형 모델인 GPT-Live-1과 GPT-Live-1 mini를 출시했습니다. 이 전이중(full-duplex) 모델은 말하고 듣는 작업을 동시에 수행할 수 있어, 사용자가 자연스럽게 말을 끊을 수 있을 뿐만 아니라 실시간 번역과 같은 기능도 지원합니다.
또한 이 회사는 ChatGPT의 기존 ‘고급 음성 모드(Advanced Voice Mode)’를 대체하는 기본 모델로 GPT-Live-1 mini를 도입하고 있습니다. 유료 요금제 사용자는 더 큰 규모의 GPT-Live-1 모델을 이용할 수 있습니다. 이전에는 시스템이 음성-텍스트 변환 모델, 응답 생성을 위한 대규모 언어 모델, 텍스트-음성 변환 모델을 조합하여 최종 출력을 생성했습니다.
오픈AI는 기자 간담회에서 새로운 모델이 사용자가 말하는 도중에 말을 끊는 문제나 질문에 답할 충분한 지능이 부족한 문제 등을 해결한다고 밝혔습니다. 업데이트된 모델은 대화 흐름을 유지하면서 검색, 추론 또는 에이전트 작업 등을 위해 GPT-5.5와 같은 최신 텍스트 모델로 쿼리를 전달할 것입니다.
또한 OpenAI는 이 모델이 말을 걸기 전까지 오랫동안 침묵을 지키며 대화 맥락을 파악할 수 있음을 시연했다. 게다가 새로운 음성 모드는 최신 GPT 모델과 통합되어 정보를 시각적으로 제시할 수 있습니다. DST와 Lux Capital으로부터 4,000만 달러의 시드 자금을 조달한 Monogram과 같은 다른 스타트업들도 어시스턴트의 상호작용성을 높이기 위해 시각적 응답에 주력하고 있습니다.
이 회사는 ChatGPT의 새로운 음성 모드가 더 긴 대화를 위해 설계되었다고 밝혔다. 브리핑에서 ChatGPT Voice의 제품 책임자인 Atty Eleti는 산책 중에 음성 기능을 이용해 30~40분 동안 대화를 나눈 적이 있다고 언급했다.
오픈AI는 음성이 복잡한 컴퓨팅 작업을 위한 주요 인터페이스가 될 수 있다고 믿습니다. 보도에 따르면 이 회사는 올해 AI 기능을 탑재한 이어버드를 출시할 수도 있는 것으로 보이지만, 하드웨어 제품에 대한 구체적인 내용은 공개되지 않았습니다.
“시간이 지남에 따라, 우리는 이것이 음성을 컴퓨팅을 위한 일종의 주요 인터페이스로 활용하고, 점점 더 복잡해지는 장기적인 에이전트 작업을 관리할 수 있는 능력을 열어줄 것이라고 생각합니다. 사람들이 코덱스(Codex)와 ChatGPT를 사용하여 달성하는 놀라운 활용 사례들을 볼 때, 음성이 모든 종류의 작업을 위한 미래의 인터페이스가 될 수 있다고 생각합니다,”라고 엘레티는 말했습니다.
오픈AI는 지난 몇 년간 ChatGPT의 음성 모드가 더 자연스럽게 들리도록 음성 기반 기능을 지속적으로 개선해 왔다. 이 회사에 따르면 1억 5천만 명 이상의 사용자가 음성 및 받아쓰기 기능을 통해 ChatGPT와 대화하고 있다.
경쟁사들도 자사 어시스턴트의 표현력을 높이기 위해 노력하고 있다.
애플과 아마존 모두 맥락 처리 능력을 개선하여 어시스턴트가 더 대화형으로 작동하도록 업데이트했습니다. 오큘러스(Oculus) 공동 창업자 브렌던 이리베(Brendan Iribe)와 안킷 쿠마르(Ankit Kumar)가 공동 설립한 세사메(Sesame)와 같은 스타트업들은 백그라운드 작업을 수행하는 동시에 더 자연스러운 대화를 나눌 수 있는 AI 어시스턴트를 출시했습니다.
오픈AI도 비슷한 길을 걷고 있으며, 사용자가 더 오랜 시간 동안 손을 쓰지 않고도 어시스턴트와 상호작용할 수 있도록 하는 것을 목표로 하고 있다. 새로운 음성 모드의 음성이 더 자연스럽다고 주장하면서도, 회사는 이 기능이 AI 동반자로 설계된 것은 아니라고 강조했다. 또한 새로운 모델에는 청소년에게 연령에 적합한 응답을 제공하고, 대화가 자해와 같은 주제를 다룰 경우 관련 자료를 제시할 수 있는 안전 장치가 포함되어 있다고 밝혔다.
새로운 음성 모드에는 여전히 개선의 여지가 있다. 힌디어 실시간 번역 기능 시연 중, 어시스턴트는 강한 미국식 억양으로 말했으며 부자연스럽고 다소 서적에서나 나올 법한 힌디어를 사용했다. 회사는 이 모드가 “가장 널리 사용되는 언어”에 최적화되어 있다고 밝혔으나, 구체적으로 어떤 언어인지는 명시하지 않았다.
관련 기사
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다
진정으로 도움이 되려면 AI 비서는 사용자를 깊이 이해해야 합니다. 일상 생활을 위해 설계된 개인 비서 ‘올리(Ollie)’는 이를 위해 사용자의 데이터를 제공하거나 개인정보를 침해할 필요가 없다는 전제 하에 운영됩니다.일부 기업용 AI 도구가 데이터 개인정보 보호 장치를 제공하기는 하지만, 올리는 SOC 2 인증을 획득한 최초의 대중적 가정용 AI 서비스
‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가
이번 정상회의에는 전 세계의 최고 경영진들이 한자리에 모여, AI에 의한 산업 혁신부터 경제 변동성에 이르기까지 글로벌 산업이 직면한 시급한 과제들을 논의할 예정입니다.‘AI LIVE: 런던 서밋’은 ‘기술 + 인간의 목적(Technology + Human Purpose)’이라는 주제로 2,000명 이상의 국제적 리더들을 한자리에 모아, 새롭게 도래하는 인
관련 특별 주제 추천
의견 (0)
0/500

OpenAI는 더 자연스러운 음성을 제공하고 대화 순서를 보다 효과적으로 관리하도록 설계된 새로운 대화형 모델인 GPT-Live-1과 GPT-Live-1 mini를 출시했습니다. 이 전이중(full-duplex) 모델은 말하고 듣는 작업을 동시에 수행할 수 있어, 사용자가 자연스럽게 말을 끊을 수 있을 뿐만 아니라 실시간 번역과 같은 기능도 지원합니다.
또한 이 회사는 ChatGPT의 기존 ‘고급 음성 모드(Advanced Voice Mode)’를 대체하는 기본 모델로 GPT-Live-1 mini를 도입하고 있습니다. 유료 요금제 사용자는 더 큰 규모의 GPT-Live-1 모델을 이용할 수 있습니다. 이전에는 시스템이 음성-텍스트 변환 모델, 응답 생성을 위한 대규모 언어 모델, 텍스트-음성 변환 모델을 조합하여 최종 출력을 생성했습니다.
오픈AI는 기자 간담회에서 새로운 모델이 사용자가 말하는 도중에 말을 끊는 문제나 질문에 답할 충분한 지능이 부족한 문제 등을 해결한다고 밝혔습니다. 업데이트된 모델은 대화 흐름을 유지하면서 검색, 추론 또는 에이전트 작업 등을 위해 GPT-5.5와 같은 최신 텍스트 모델로 쿼리를 전달할 것입니다.
또한 OpenAI는 이 모델이 말을 걸기 전까지 오랫동안 침묵을 지키며 대화 맥락을 파악할 수 있음을 시연했다. 게다가 새로운 음성 모드는 최신 GPT 모델과 통합되어 정보를 시각적으로 제시할 수 있습니다. DST와 Lux Capital으로부터 4,000만 달러의 시드 자금을 조달한 Monogram과 같은 다른 스타트업들도 어시스턴트의 상호작용성을 높이기 위해 시각적 응답에 주력하고 있습니다.
이 회사는 ChatGPT의 새로운 음성 모드가 더 긴 대화를 위해 설계되었다고 밝혔다. 브리핑에서 ChatGPT Voice의 제품 책임자인 Atty Eleti는 산책 중에 음성 기능을 이용해 30~40분 동안 대화를 나눈 적이 있다고 언급했다.
오픈AI는 음성이 복잡한 컴퓨팅 작업을 위한 주요 인터페이스가 될 수 있다고 믿습니다. 보도에 따르면 이 회사는 올해 AI 기능을 탑재한 이어버드를 출시할 수도 있는 것으로 보이지만, 하드웨어 제품에 대한 구체적인 내용은 공개되지 않았습니다.
“시간이 지남에 따라, 우리는 이것이 음성을 컴퓨팅을 위한 일종의 주요 인터페이스로 활용하고, 점점 더 복잡해지는 장기적인 에이전트 작업을 관리할 수 있는 능력을 열어줄 것이라고 생각합니다. 사람들이 코덱스(Codex)와 ChatGPT를 사용하여 달성하는 놀라운 활용 사례들을 볼 때, 음성이 모든 종류의 작업을 위한 미래의 인터페이스가 될 수 있다고 생각합니다,”라고 엘레티는 말했습니다.
오픈AI는 지난 몇 년간 ChatGPT의 음성 모드가 더 자연스럽게 들리도록 음성 기반 기능을 지속적으로 개선해 왔다. 이 회사에 따르면 1억 5천만 명 이상의 사용자가 음성 및 받아쓰기 기능을 통해 ChatGPT와 대화하고 있다.
경쟁사들도 자사 어시스턴트의 표현력을 높이기 위해 노력하고 있다.
애플과 아마존 모두 맥락 처리 능력을 개선하여 어시스턴트가 더 대화형으로 작동하도록 업데이트했습니다. 오큘러스(Oculus) 공동 창업자 브렌던 이리베(Brendan Iribe)와 안킷 쿠마르(Ankit Kumar)가 공동 설립한 세사메(Sesame)와 같은 스타트업들은 백그라운드 작업을 수행하는 동시에 더 자연스러운 대화를 나눌 수 있는 AI 어시스턴트를 출시했습니다.
오픈AI도 비슷한 길을 걷고 있으며, 사용자가 더 오랜 시간 동안 손을 쓰지 않고도 어시스턴트와 상호작용할 수 있도록 하는 것을 목표로 하고 있다. 새로운 음성 모드의 음성이 더 자연스럽다고 주장하면서도, 회사는 이 기능이 AI 동반자로 설계된 것은 아니라고 강조했다. 또한 새로운 모델에는 청소년에게 연령에 적합한 응답을 제공하고, 대화가 자해와 같은 주제를 다룰 경우 관련 자료를 제시할 수 있는 안전 장치가 포함되어 있다고 밝혔다.
새로운 음성 모드에는 여전히 개선의 여지가 있다. 힌디어 실시간 번역 기능 시연 중, 어시스턴트는 강한 미국식 억양으로 말했으며 부자연스럽고 다소 서적에서나 나올 법한 힌디어를 사용했다. 회사는 이 모드가 “가장 널리 사용되는 언어”에 최적화되어 있다고 밝혔으나, 구체적으로 어떤 언어인지는 명시하지 않았다.
올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다
진정으로 도움이 되려면 AI 비서는 사용자를 깊이 이해해야 합니다. 일상 생활을 위해 설계된 개인 비서 ‘올리(Ollie)’는 이를 위해 사용자의 데이터를 제공하거나 개인정보를 침해할 필요가 없다는 전제 하에 운영됩니다.일부 기업용 AI 도구가 데이터 개인정보 보호 장치를 제공하기는 하지만, 올리는 SOC 2 인증을 획득한 최초의 대중적 가정용 AI 서비스
‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가
이번 정상회의에는 전 세계의 최고 경영진들이 한자리에 모여, AI에 의한 산업 혁신부터 경제 변동성에 이르기까지 글로벌 산업이 직면한 시급한 과제들을 논의할 예정입니다.‘AI LIVE: 런던 서밋’은 ‘기술 + 인간의 목적(Technology + Human Purpose)’이라는 주제로 2,000명 이상의 국제적 리더들을 한자리에 모아, 새롭게 도래하는 인





집






