참깨는 바이러스 성 가상 어시스턴트 Maya의 기본 AI 모델을 공개합니다.

Sesame, 혁신적인 AI 회사로, 놀랍도록 생생한 음성 비서 Maya를 개발했으며, 최근 그녀의 기능을 구동하는 기본 모델을 공개해 화제를 모았다. CSM-1B로 명명된 이 모델은 10억 개의 파라미터를 자랑하며, 이는 모델을 구성하는 개별 요소를 의미한다. Apache 2.0 라이선스 하에 공개되어 AI 개발 플랫폼 Hugging Face에서 발표된 바와 같이 상업적 사용에 최소한의 제약이 있다.
CSM-1B는 텍스트와 오디오 입력을 "RVQ 오디오 코드"로 변환하여 작동한다. RVQ는 "잔여 벡터 양자화"를 의미하며, 오디오를 이산 토큰 또는 코드로 변환하는 방법이다. 이 기술은 Google의 SoundStream 및 Meta의 Encodec과 같은 최첨단 AI 오디오 기술에서도 사용된다. 핵심적으로 CSM-1B는 Meta의 Llama 패밀리 모델과 오디오 "디코더" 컴포넌트를 결합한다. Sesame에 따르면, CSM-1B의 특화된 버전이 파인튜닝 후 Maya의 음성을 구동한다.
Hugging Face와 GitHub 저장소에서 이 모델을 "기본 생성 모델"로 설명하며, Sesame는 다양한 음성을 생성하도록 설계되었지만 특정 음성에 대해 정제되지 않았다고 밝혔다. 훈련 데이터의 "데이터 오염" 덕분에 비영어 언어를 어느 정도 처리할 수 있지만, 이 분야에서의 성능은 아마도 미흡할 것이다. 흥미롭게도 Sesame는 훈련 데이터의 세부 사항을 비공개로 유지해 이 모델 구축에 어떤 요소가 포함되었는지 궁금증을 남긴다.
눈썹을 치켜세우는 한 가지 측면은 강력한 안전 장치의 부재다. Sesame는 명예 시스템에 따라 운영되며, 사용자와 개발자에게 모델을 사용해 허가 없이 누군가의 음성을 복제하거나, 가짜 뉴스와 같은 오해를 불러일으키는 콘텐츠를 생성하거나, "해로운" 또는 "악의적인" 활동에 참여하지 말 것을 간단히 권장한다. 나는 Hugging Face의 데모를 직접 테스트했으며, 1분 만에 내 음성을 복제했다. 선거나 러시아 선전과 같은 민감한 주제에 대한 음성을 생성하는 것도 매우 쉬웠다.
Consumer Reports는 최근 많은 AI 기반 음성 복제 도구에 "의미 있는" 안전 장치가 부족해 잠재적인 사기나 남용으로 이어질 수 있다고 강조했다. Oculus 공동 창립자 Brendan Iribe가 공동 설립한 Sesame는 2월 말, 거의 언캐니 밸리를 벗어나는 비서 기술로 대중의 주목을 끌었다. Maya와 Sesame의 다른 비서 Miles는 숨을 쉬거나, 말할 때 불완전성을 보이며, 중간에 말을 끊을 수 있는 등 OpenAI의 Voice Mode와 유사한 현실적인 인간적 특성을 보여준다.
재정적으로 Sesame는 Andreessen Horowitz, Spark Capital, Matrix Partners와 같은 거물들로부터 비공개 자금을 확보했다. 음성 비서 외에도, 이 회사는 하루 종일 착용 가능한 AI 안경 프로토타입 제작에 도전하고 있으며, 이는 그들의 커스텀 모델로 구동된다. 이 움직임은 Sesame가 AI 기술을 우리 일상생활에 더욱 깊이 밀어 넣으려는 야심을 보여준다.
관련 기사
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다
진정으로 도움이 되려면 AI 비서는 사용자를 깊이 이해해야 합니다. 일상 생활을 위해 설계된 개인 비서 ‘올리(Ollie)’는 이를 위해 사용자의 데이터를 제공하거나 개인정보를 침해할 필요가 없다는 전제 하에 운영됩니다.일부 기업용 AI 도구가 데이터 개인정보 보호 장치를 제공하기는 하지만, 올리는 SOC 2 인증을 획득한 최초의 대중적 가정용 AI 서비스
‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가
이번 정상회의에는 전 세계의 최고 경영진들이 한자리에 모여, AI에 의한 산업 혁신부터 경제 변동성에 이르기까지 글로벌 산업이 직면한 시급한 과제들을 논의할 예정입니다.‘AI LIVE: 런던 서밋’은 ‘기술 + 인간의 목적(Technology + Human Purpose)’이라는 주제로 2,000명 이상의 국제적 리더들을 한자리에 모아, 새롭게 도래하는 인
관련 특별 주제 추천
의견 (8)
0/500
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯

Sesame, 혁신적인 AI 회사로, 놀랍도록 생생한 음성 비서 Maya를 개발했으며, 최근 그녀의 기능을 구동하는 기본 모델을 공개해 화제를 모았다. CSM-1B로 명명된 이 모델은 10억 개의 파라미터를 자랑하며, 이는 모델을 구성하는 개별 요소를 의미한다. Apache 2.0 라이선스 하에 공개되어 AI 개발 플랫폼 Hugging Face에서 발표된 바와 같이 상업적 사용에 최소한의 제약이 있다.
CSM-1B는 텍스트와 오디오 입력을 "RVQ 오디오 코드"로 변환하여 작동한다. RVQ는 "잔여 벡터 양자화"를 의미하며, 오디오를 이산 토큰 또는 코드로 변환하는 방법이다. 이 기술은 Google의 SoundStream 및 Meta의 Encodec과 같은 최첨단 AI 오디오 기술에서도 사용된다. 핵심적으로 CSM-1B는 Meta의 Llama 패밀리 모델과 오디오 "디코더" 컴포넌트를 결합한다. Sesame에 따르면, CSM-1B의 특화된 버전이 파인튜닝 후 Maya의 음성을 구동한다.
Hugging Face와 GitHub 저장소에서 이 모델을 "기본 생성 모델"로 설명하며, Sesame는 다양한 음성을 생성하도록 설계되었지만 특정 음성에 대해 정제되지 않았다고 밝혔다. 훈련 데이터의 "데이터 오염" 덕분에 비영어 언어를 어느 정도 처리할 수 있지만, 이 분야에서의 성능은 아마도 미흡할 것이다. 흥미롭게도 Sesame는 훈련 데이터의 세부 사항을 비공개로 유지해 이 모델 구축에 어떤 요소가 포함되었는지 궁금증을 남긴다.
눈썹을 치켜세우는 한 가지 측면은 강력한 안전 장치의 부재다. Sesame는 명예 시스템에 따라 운영되며, 사용자와 개발자에게 모델을 사용해 허가 없이 누군가의 음성을 복제하거나, 가짜 뉴스와 같은 오해를 불러일으키는 콘텐츠를 생성하거나, "해로운" 또는 "악의적인" 활동에 참여하지 말 것을 간단히 권장한다. 나는 Hugging Face의 데모를 직접 테스트했으며, 1분 만에 내 음성을 복제했다. 선거나 러시아 선전과 같은 민감한 주제에 대한 음성을 생성하는 것도 매우 쉬웠다.
Consumer Reports는 최근 많은 AI 기반 음성 복제 도구에 "의미 있는" 안전 장치가 부족해 잠재적인 사기나 남용으로 이어질 수 있다고 강조했다. Oculus 공동 창립자 Brendan Iribe가 공동 설립한 Sesame는 2월 말, 거의 언캐니 밸리를 벗어나는 비서 기술로 대중의 주목을 끌었다. Maya와 Sesame의 다른 비서 Miles는 숨을 쉬거나, 말할 때 불완전성을 보이며, 중간에 말을 끊을 수 있는 등 OpenAI의 Voice Mode와 유사한 현실적인 인간적 특성을 보여준다.
재정적으로 Sesame는 Andreessen Horowitz, Spark Capital, Matrix Partners와 같은 거물들로부터 비공개 자금을 확보했다. 음성 비서 외에도, 이 회사는 하루 종일 착용 가능한 AI 안경 프로토타입 제작에 도전하고 있으며, 이는 그들의 커스텀 모델로 구동된다. 이 움직임은 Sesame가 AI 기술을 우리 일상생활에 더욱 깊이 밀어 넣으려는 야심을 보여준다.
올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다
진정으로 도움이 되려면 AI 비서는 사용자를 깊이 이해해야 합니다. 일상 생활을 위해 설계된 개인 비서 ‘올리(Ollie)’는 이를 위해 사용자의 데이터를 제공하거나 개인정보를 침해할 필요가 없다는 전제 하에 운영됩니다.일부 기업용 AI 도구가 데이터 개인정보 보호 장치를 제공하기는 하지만, 올리는 SOC 2 인증을 획득한 최초의 대중적 가정용 AI 서비스
‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가
이번 정상회의에는 전 세계의 최고 경영진들이 한자리에 모여, AI에 의한 산업 혁신부터 경제 변동성에 이르기까지 글로벌 산업이 직면한 시급한 과제들을 논의할 예정입니다.‘AI LIVE: 런던 서밋’은 ‘기술 + 인간의 목적(Technology + Human Purpose)’이라는 주제로 2,000명 이상의 국제적 리더들을 한자리에 모아, 새롭게 도래하는 인
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯





집






