Openai는 아직 1 년 후 음성 복제 도구를 출시하지 않았습니다.
OpenAI의 보이스 엔진: 오랫동안 기다려온 출시?
지난 3월 말, OpenAI는 단 15초의 음성으로 사람의 목소리를 복제할 수 있는 AI 서비스인 보이스 엔진(Voice Engine)의 "소규모 미리보기"를 소개했습니다. 1년이 지난 지금, 이 도구는 여전히 미리보기 모드에 있으며, 정식 출시 일정은 명확하지 않습니다. 심지어 이 도구가 세상에 공개될 것인지도 확실하지 않습니다.
보이스 엔진을 광범위하게 출시하지 않는 망설임은 오용에 대한 우려나 규제 감시를 피하려는 시도에서 비롯된 것일 수 있습니다. OpenAI는 과거에 안전보다 화려한 제품을 우선시하고 경쟁사보다 먼저 시장에 출시하려고 서두른다는 비판을 받아왔습니다.
OpenAI 대변인은 TechCrunch에 회사가 "신뢰할 수 있는 파트너" 그룹과 함께 보이스 엔진을 테스트하고 있다고 밝혔습니다. 대변인은 "파트너들이 기술을 어떻게 활용하는지 배우면서 모델의 유용성과 안전성을 향상시키고 있습니다."라고 설명했습니다. "음성 치료, 언어 학습, 고객 지원, 비디오 게임 캐릭터, AI 아바타에 이르기까지 다양한 응용 사례를 보는 것은 흥미롭습니다."
보이스 엔진: 지금까지의 여정
보이스 엔진은 OpenAI의 텍스트-음성 변환 API와 ChatGPT의 보이스 모드에서 음성을 구현하며, 원래 화자의 목소리를 매우 자연스럽게 모방하는 음성을 생성합니다. 텍스트를 음성으로 변환하며, 특정 콘텐츠 가이드라인에만 제약을 받습니다. 하지만 출시는 처음부터 지연과 변동하는 출시 일정으로 어려움을 겪었습니다.
2024년 6월 블로그 포스트에서 OpenAI는 보이스 엔진 모델이 다양한 음성, 억양, 말하는 스타일을 고려하여 주어진 텍스트에 대해 화자가 어떤 소리를 낼지 예측하는 방법을 배운다고 자세히 설명했습니다. 이를 통해 모델은 텍스트에서 음성을 생성할 뿐만 아니라 다양한 화자가 텍스트를 소리 내어 말하는 방식을 반영한 "음성 발화"를 생성할 수 있습니다.
원래 보이스 엔진은 당시 커스텀 보이스(Custom Voices)로 불리며, TechCrunch가 본 초안 블로그 포스트에 따르면 2024년 3월 7일 OpenAI의 API에 추가될 예정이었습니다. 계획은 최대 100명의 "신뢰할 수 있는 개발자"에게 우선적으로 접근을 제공하며, 사회적 이익을 위한 앱을 개발하거나 기술의 혁신적이고 책임감 있는 사용을 보여주는 개발자를 우선시하는 것이었습니다. OpenAI는 이미 서비스를 상표 등록하고 "표준" 음성에 대해 백만 자당 15달러, "HD 품질" 음성에 대해 백만 자당 30달러로 가격을 책정했습니다.
하지만 마지막 순간에 발표가 연기되었습니다. 몇 주 후, OpenAI는 가입 옵션 없이 보이스 엔진을 공개하며, 2023년 말부터 협력해온 소규모 개발자 그룹으로 접근을 제한했습니다.
OpenAI는 2024년 3월 말 발표 블로그 포스트에서 "합성 음성의 책임 있는 배포와 사회가 이러한 새로운 기능에 어떻게 적응할 수 있는지에 대한 대화를 시작하고자 합니다."라고 밝혔습니다. "이러한 대화와 소규모 테스트 결과를 바탕으로, 우리는 이 기술을 대규모로 배포할지, 그리고 어떻게 배포할지에 대해 보다 정보에 입각한 결정을 내릴 것입니다."
긴 개발 여정
보이스 엔진은 2022년부터 개발 중이며, OpenAI는 2023년 여름에 글로벌 정책 입안자들에게 그 잠재력과 위험성을 보여주었습니다. 현재 여러 파트너가 보이스 엔진에 접근할 수 있으며, 그중에는 장애인을 보다 자연스럽게 소통할 수 있도록 돕는 스타트업 Livox도 포함됩니다. 하지만 Livox CEO 카를로스 페레이라(Carlos Pereira)는 보이스 엔진이 인터넷 연결을 요구하기 때문에 자사 제품에 통합할 수 없었다고 밝혔습니다. 이는 많은 고객이 인터넷에 접근할 수 없는 상황이기 때문입니다. 페레이라는 TechCrunch에 이메일로 "음성의 품질과 다양한 언어로 말할 수 있는 능력은 특히 장애가 있는 고객들에게 독특합니다."라고 말했습니다. "내가 본 음성 생성 도구 중 가장 인상적이고 사용하기 쉬운 도구입니다... OpenAI가 곧 오프라인 버전을 개발하기를 바랍니다."
페레이라는 OpenAI로부터 출시 날짜나 서비스 요금 부과 계획에 대한 어떠한 정보도 받지 못했으며, 현재까지 Livox는 사용료를 지불하지 않았습니다.
2024년 6월 포스트에서 OpenAI는 미국 선거 주기 동안 오용 가능성 때문에 보이스 엔진 출시를 연기한 이유 중 하나를 언급했습니다. 회사는 생성된 오디오의 출처를 추적하기 위한 워터마킹 같은 안전 조치를 구현했습니다. 개발자는 원래 화자로부터 "명시적 동의"를 얻어야 하며, 음성이 AI로 생성된 것임을 청중에 "명확히 공개"해야 합니다. 하지만 OpenAI는 이러한 정책이 대규모로 어떻게 집행될지에 대한 세부 사항을 밝히지 않았으며, 이는 큰 도전 과제가 될 수 있습니다.
OpenAI는 또한 화자를 검증하는 "음성 인증 경험"을 구축하고 저명한 인물의 음성을 생성하지 못하도록 하는 "금지 목록"을 만드는 계획을 암시했습니다. 이는 야심찬 프로젝트이며, 실수가 있다면 OpenAI의 안전 이니셔티브에 대한 평판에 추가적인 손상을 줄 수 있습니다.
효과적인 필터링과 신원 확인은 음성 복제 기술을 책임감 있게 출시하기 위해 점점 더 필수적입니다. AI 음성 복제는 2024년 세 번째로 빠르게 성장한 사기로, 사기와 은행 보안 점검 우회를 초래하며 개인정보 보호 및 저작권법이 이를 따라잡지 못하고 있습니다. 악의적인 행위자들은 음성 복제를 사용해 유명인과 정치인의 딥페이크를 만들어 소셜 미디어에서 빠르게 퍼뜨렸습니다.
OpenAI는 다음 주에 보이스 엔진을 출시할 수도 있고, 영원히 출시하지 않을 수도 있습니다. 회사는 서비스를 소규모로 유지하는 것을 고려하고 있다고 언급했습니다. 하지만 한 가지는 확실합니다. 광학적 이유든, 안전 때문이든, 아니면 둘 다 때문이든, 보이스 엔진의 제한된 미리보기는 OpenAI 역사상 가장 긴 미리보기 중 하나가 되었습니다.
관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
관련 특별 주제 추천
의견 (15)
0/500
これ、もう1年も経つのにまだプレビュー版なんだね。音声クローン技術って倫理的にすごくデリケートな問題だから、慎重に進めるのは理解できるけど、市場の期待はずっと先送りされてる感じ。他のAI企業はどんどん類似機能をリリースしてるのに、OpenAIは何を待ってるんだろう?🤔 もしかしたら、悪用防止の仕組みを完璧にしたいのかな。でも、待たされるユーザーとしては少しイライラするかも…
Ça fait un an qu'ils promettent cette technologie et toujours rien ? 😅 Moi qui voulais créer une voix IA de mon chat, je crois que je vais devoir attendre encore longtemps. C'est bizarre cette absence de calendrier, peut-être qu'ils ont des problèmes éthiques à régler ?
これ、去年発表されたまま音沙汰ないんですね🤔 声の合成技術は確かにすごいけど、どんな懸念があって公開をためらっているのか気になります。もしかして悪用されそうで怖いからかな?早く使ってみたいけど、慎重になる気持ちもわかる…
¿Un año y todavía no han soltado esa herramienta de clonación de voz? 🤔 Me pregunto si será por problemas técnicos o por miedo al mal uso. Suena a que tiene mucho potencial, pero también da un poco de miedo pensando en el deepfake.
Why's OpenAI dragging their feet on Voice Engine? A year later and still just a preview? Sounds like they're scared of the ethical mess this could stir up. 😬
OpenAI의 보이스 엔진: 오랫동안 기다려온 출시?
지난 3월 말, OpenAI는 단 15초의 음성으로 사람의 목소리를 복제할 수 있는 AI 서비스인 보이스 엔진(Voice Engine)의 "소규모 미리보기"를 소개했습니다. 1년이 지난 지금, 이 도구는 여전히 미리보기 모드에 있으며, 정식 출시 일정은 명확하지 않습니다. 심지어 이 도구가 세상에 공개될 것인지도 확실하지 않습니다.
보이스 엔진을 광범위하게 출시하지 않는 망설임은 오용에 대한 우려나 규제 감시를 피하려는 시도에서 비롯된 것일 수 있습니다. OpenAI는 과거에 안전보다 화려한 제품을 우선시하고 경쟁사보다 먼저 시장에 출시하려고 서두른다는 비판을 받아왔습니다.
OpenAI 대변인은 TechCrunch에 회사가 "신뢰할 수 있는 파트너" 그룹과 함께 보이스 엔진을 테스트하고 있다고 밝혔습니다. 대변인은 "파트너들이 기술을 어떻게 활용하는지 배우면서 모델의 유용성과 안전성을 향상시키고 있습니다."라고 설명했습니다. "음성 치료, 언어 학습, 고객 지원, 비디오 게임 캐릭터, AI 아바타에 이르기까지 다양한 응용 사례를 보는 것은 흥미롭습니다."
보이스 엔진: 지금까지의 여정
보이스 엔진은 OpenAI의 텍스트-음성 변환 API와 ChatGPT의 보이스 모드에서 음성을 구현하며, 원래 화자의 목소리를 매우 자연스럽게 모방하는 음성을 생성합니다. 텍스트를 음성으로 변환하며, 특정 콘텐츠 가이드라인에만 제약을 받습니다. 하지만 출시는 처음부터 지연과 변동하는 출시 일정으로 어려움을 겪었습니다.
2024년 6월 블로그 포스트에서 OpenAI는 보이스 엔진 모델이 다양한 음성, 억양, 말하는 스타일을 고려하여 주어진 텍스트에 대해 화자가 어떤 소리를 낼지 예측하는 방법을 배운다고 자세히 설명했습니다. 이를 통해 모델은 텍스트에서 음성을 생성할 뿐만 아니라 다양한 화자가 텍스트를 소리 내어 말하는 방식을 반영한 "음성 발화"를 생성할 수 있습니다.
원래 보이스 엔진은 당시 커스텀 보이스(Custom Voices)로 불리며, TechCrunch가 본 초안 블로그 포스트에 따르면 2024년 3월 7일 OpenAI의 API에 추가될 예정이었습니다. 계획은 최대 100명의 "신뢰할 수 있는 개발자"에게 우선적으로 접근을 제공하며, 사회적 이익을 위한 앱을 개발하거나 기술의 혁신적이고 책임감 있는 사용을 보여주는 개발자를 우선시하는 것이었습니다. OpenAI는 이미 서비스를 상표 등록하고 "표준" 음성에 대해 백만 자당 15달러, "HD 품질" 음성에 대해 백만 자당 30달러로 가격을 책정했습니다.
하지만 마지막 순간에 발표가 연기되었습니다. 몇 주 후, OpenAI는 가입 옵션 없이 보이스 엔진을 공개하며, 2023년 말부터 협력해온 소규모 개발자 그룹으로 접근을 제한했습니다.
OpenAI는 2024년 3월 말 발표 블로그 포스트에서 "합성 음성의 책임 있는 배포와 사회가 이러한 새로운 기능에 어떻게 적응할 수 있는지에 대한 대화를 시작하고자 합니다."라고 밝혔습니다. "이러한 대화와 소규모 테스트 결과를 바탕으로, 우리는 이 기술을 대규모로 배포할지, 그리고 어떻게 배포할지에 대해 보다 정보에 입각한 결정을 내릴 것입니다."
긴 개발 여정
보이스 엔진은 2022년부터 개발 중이며, OpenAI는 2023년 여름에 글로벌 정책 입안자들에게 그 잠재력과 위험성을 보여주었습니다. 현재 여러 파트너가 보이스 엔진에 접근할 수 있으며, 그중에는 장애인을 보다 자연스럽게 소통할 수 있도록 돕는 스타트업 Livox도 포함됩니다. 하지만 Livox CEO 카를로스 페레이라(Carlos Pereira)는 보이스 엔진이 인터넷 연결을 요구하기 때문에 자사 제품에 통합할 수 없었다고 밝혔습니다. 이는 많은 고객이 인터넷에 접근할 수 없는 상황이기 때문입니다. 페레이라는 TechCrunch에 이메일로 "음성의 품질과 다양한 언어로 말할 수 있는 능력은 특히 장애가 있는 고객들에게 독특합니다."라고 말했습니다. "내가 본 음성 생성 도구 중 가장 인상적이고 사용하기 쉬운 도구입니다... OpenAI가 곧 오프라인 버전을 개발하기를 바랍니다."
페레이라는 OpenAI로부터 출시 날짜나 서비스 요금 부과 계획에 대한 어떠한 정보도 받지 못했으며, 현재까지 Livox는 사용료를 지불하지 않았습니다.
2024년 6월 포스트에서 OpenAI는 미국 선거 주기 동안 오용 가능성 때문에 보이스 엔진 출시를 연기한 이유 중 하나를 언급했습니다. 회사는 생성된 오디오의 출처를 추적하기 위한 워터마킹 같은 안전 조치를 구현했습니다. 개발자는 원래 화자로부터 "명시적 동의"를 얻어야 하며, 음성이 AI로 생성된 것임을 청중에 "명확히 공개"해야 합니다. 하지만 OpenAI는 이러한 정책이 대규모로 어떻게 집행될지에 대한 세부 사항을 밝히지 않았으며, 이는 큰 도전 과제가 될 수 있습니다.
OpenAI는 또한 화자를 검증하는 "음성 인증 경험"을 구축하고 저명한 인물의 음성을 생성하지 못하도록 하는 "금지 목록"을 만드는 계획을 암시했습니다. 이는 야심찬 프로젝트이며, 실수가 있다면 OpenAI의 안전 이니셔티브에 대한 평판에 추가적인 손상을 줄 수 있습니다.
효과적인 필터링과 신원 확인은 음성 복제 기술을 책임감 있게 출시하기 위해 점점 더 필수적입니다. AI 음성 복제는 2024년 세 번째로 빠르게 성장한 사기로, 사기와 은행 보안 점검 우회를 초래하며 개인정보 보호 및 저작권법이 이를 따라잡지 못하고 있습니다. 악의적인 행위자들은 음성 복제를 사용해 유명인과 정치인의 딥페이크를 만들어 소셜 미디어에서 빠르게 퍼뜨렸습니다.
OpenAI는 다음 주에 보이스 엔진을 출시할 수도 있고, 영원히 출시하지 않을 수도 있습니다. 회사는 서비스를 소규모로 유지하는 것을 고려하고 있다고 언급했습니다. 하지만 한 가지는 확실합니다. 광학적 이유든, 안전 때문이든, 아니면 둘 다 때문이든, 보이스 엔진의 제한된 미리보기는 OpenAI 역사상 가장 긴 미리보기 중 하나가 되었습니다.
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
これ、もう1年も経つのにまだプレビュー版なんだね。音声クローン技術って倫理的にすごくデリケートな問題だから、慎重に進めるのは理解できるけど、市場の期待はずっと先送りされてる感じ。他のAI企業はどんどん類似機能をリリースしてるのに、OpenAIは何を待ってるんだろう?🤔 もしかしたら、悪用防止の仕組みを完璧にしたいのかな。でも、待たされるユーザーとしては少しイライラするかも…
Ça fait un an qu'ils promettent cette technologie et toujours rien ? 😅 Moi qui voulais créer une voix IA de mon chat, je crois que je vais devoir attendre encore longtemps. C'est bizarre cette absence de calendrier, peut-être qu'ils ont des problèmes éthiques à régler ?
これ、去年発表されたまま音沙汰ないんですね🤔 声の合成技術は確かにすごいけど、どんな懸念があって公開をためらっているのか気になります。もしかして悪用されそうで怖いからかな?早く使ってみたいけど、慎重になる気持ちもわかる…
¿Un año y todavía no han soltado esa herramienta de clonación de voz? 🤔 Me pregunto si será por problemas técnicos o por miedo al mal uso. Suena a que tiene mucho potencial, pero también da un poco de miedo pensando en el deepfake.
Why's OpenAI dragging their feet on Voice Engine? A year later and still just a preview? Sounds like they're scared of the ethical mess this could stir up. 😬





집






