AI 벤치 마크 : 지금은 무시해야합니까?
TechCrunch의 정기 AI 뉴스레터에 오신 것을 환영합니다! 잠시 휴식을 취하지만, 걱정하지 마세요. TechCrunch에서 제 칼럼, 일일 분석, 속보를 포함한 모든 AI 관련 소식을 여전히 확인할 수 있습니다. 매일 이메일로 이 소식을 받고 싶으신가요? 여기에서 일일 뉴스레터에 가입하세요.
이번 주, 엘론 머스크의 AI 스타트업 xAI가 최신 플래그십 AI 모델 Grok 3를 공개했습니다. 이 모델은 회사의 Grok 챗봇 앱을 구동하며, 무려 200,000개의 GPU로 훈련되었습니다. 수학, 코딩 등의 벤치마크에서 OpenAI의 일부 모델을 포함한 여러 최고 모델을 능가하고 있습니다.
하지만 이 벤치마크가 실제로 의미하는 바를 살펴봅시다.
TC에서는 이러한 벤치마크 수치를 보도하지만, 항상 기뻐하지는 않습니다. 왜냐하면 이는 AI 산업이 모델의 개선을 보여주기 위해 사용하는 몇 안 되는 방법 중 하나이기 때문입니다. 문제는 이러한 인기 있는 AI 벤치마크가 종종 모호한 것에 초점을 맞추고, 사람들이 실제로 중요하게 여기는 작업에서의 AI 성능을 제대로 반영하지 않는 점수로 나타난다는 점입니다.
Wharton의 교수인 Ethan Mollick은 X에서 더 나은 테스트와 이를 수행할 독립적인 단체가 필요하다고 말했습니다. 그는 AI 회사들이 종종 자체 벤치마크 결과를 보고하기 때문에 이를 완전히 신뢰하기 어렵다고 지적했습니다.
"공공 벤치마크는 '그저 그렇다'고 할 수 있으며, 포화 상태에 있어 AI 테스트는 음식 리뷰처럼 취향에 기반한 경우가 많습니다,"라고 Mollick은 썼습니다. "AI가 업무에 중요하다면, 더 많은 것이 필요합니다."
AI를 위한 새로운 벤치마크를 만들려는 사람들이 많지만, 무엇이 최선인지에 대한 합의는 없습니다. 일부는 벤치마크가 유용하려면 경제적 영향에 초점을 맞춰야 한다고 생각하고, 다른 이들은 실세계에서의 채택과 유용성이 성공의 진정한 척도라고 믿습니다.
이 논쟁은 영원히 계속될 수 있습니다. 아마도 X 사용자 Roon이 제안한 것처럼, 새로운 모델과 벤치마크에 덜 신경 쓰고, 주요 AI 돌파구가 있을 때까지 기다리는 것이 정신 건강에 더 좋을지도 모릅니다. 비록 그로 인해 일부 AI 과대 광고를 놓치더라도 말입니다.
앞서 언급했듯이, This Week in AI는 휴식을 취합니다. 독자 여러분, 모든 기복을 함께해 주셔서 감사합니다. 다음에 만나요.
뉴스

이미지 제공: Nathan Laine/Bloomberg / Getty Images OpenAI는 ChatGPT를 "검열 해제"하려고 합니다. Max는 그들이 "지적 자유"를 수용하기 위해 AI 개발 접근 방식을 변경하고 있으며, 심지어 어렵거나 논란이 되는 주제에서도 이를 적용한다고 썼습니다.OpenAI의 전 CTO인 Mira Murati는 Thinking Machines Lab이라는 새로운 스타트업을 설립했습니다. 그들은 "[사람들의 고유한 필요와 목표]를 위한 AI 작업"을 만드는 도구를 개발 중입니다.
xAI는 Grok 3를 출시하고 iOS와 웹용 Grok 앱에 새로운 기능을 추가했습니다.
Meta는 올봄 첫 번째 생성 AI 중심 개발자 컨퍼런스를 개최합니다. Llama 모델의 이름을 딴 LlamaCon으로, 4월 29일에 열립니다.
Paul은 약 20개 조직이 참여한 OpenEuroLLM 프로젝트에 대해 썼습니다. 이 프로젝트는 모든 EU 언어의 "언어적, 문화적 다양성"을 존중하는 "유럽의 투명한 AI"를 위한 기반 모델을 구축하는 것입니다.
이번 주의 연구 논문

이미지 제공: Jakub Porzycki/NurPhoto / Getty Images OpenAI 연구원들은 AI의 코딩 능력을 테스트하기 위해 SWE-Lancer라는 새로운 AI 벤치마크를 개발했습니다. 이는 버그 수정, 기능 추가, 기술 구현 제안 등 1,400개 이상의 프리랜서 소프트웨어 엔지니어링 작업으로 구성되어 있습니다.OpenAI는 최고 성능 모델인 Anthropic의 Claude 3.5 Sonnet이 전체 SWE-Lancer 벤치마크에서 40.3%만 기록했다고 밝혔으며, 이는 AI가 아직 갈 길이 멀다는 것을 보여줍니다. 그들은 OpenAI의 o3-mini나 중국의 DeepSeek의 R1 같은 최신 모델은 테스트하지 않았습니다.
이번 주의 모델
Stepfun이라는 중국 AI 회사가 중국어, 영어, 일본어로 음성을 이해하고 생성할 수 있는 "오픈" AI 모델 Step-Audio를 출시했습니다. 사용자는 합성 오디오의 감정과 방언, 심지어 노래까지 조정할 수 있습니다.
Stepfun은 관대한 라이선스로 모델을 출시하는 잘 자금 지원받는 중국 AI 스타트업 중 하나입니다. 2023년에 설립된 이들은 최근 중국 국영 사모펀드 투자자들로부터 수억 달러 규모의 펀딩 라운드를 마무리했습니다.
잡다한 소식

이미지 제공: Nous Research AI 연구 그룹인 Nous Research는 추론과 "직관적인 언어 모델 기능"을 결합한 최초의 AI 모델 중 하나를 출시했다고 주장합니다.그들의 모델 DeepHermes-3 Preview는 정확성과 계산 능력을 균형 있게 유지하기 위해 짧고 긴 "사고의 연쇄"를 전환할 수 있습니다. "추론" 모드에서는 더 어려운 문제를 해결하는 데 시간이 더 걸리며, 그 과정에서 사고 과정을 보여줍니다.
Anthropic은 곧 비슷한 모델을 출시할 계획이라고 하며, OpenAI도 단기 로드맵에 있다고 밝혔습니다.
관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
관련 특별 주제 추천
의견 (62)
0/500
I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.
AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.
AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?
AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔
AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐
TechCrunch의 정기 AI 뉴스레터에 오신 것을 환영합니다! 잠시 휴식을 취하지만, 걱정하지 마세요. TechCrunch에서 제 칼럼, 일일 분석, 속보를 포함한 모든 AI 관련 소식을 여전히 확인할 수 있습니다. 매일 이메일로 이 소식을 받고 싶으신가요? 여기에서 일일 뉴스레터에 가입하세요.
이번 주, 엘론 머스크의 AI 스타트업 xAI가 최신 플래그십 AI 모델 Grok 3를 공개했습니다. 이 모델은 회사의 Grok 챗봇 앱을 구동하며, 무려 200,000개의 GPU로 훈련되었습니다. 수학, 코딩 등의 벤치마크에서 OpenAI의 일부 모델을 포함한 여러 최고 모델을 능가하고 있습니다.
하지만 이 벤치마크가 실제로 의미하는 바를 살펴봅시다.
TC에서는 이러한 벤치마크 수치를 보도하지만, 항상 기뻐하지는 않습니다. 왜냐하면 이는 AI 산업이 모델의 개선을 보여주기 위해 사용하는 몇 안 되는 방법 중 하나이기 때문입니다. 문제는 이러한 인기 있는 AI 벤치마크가 종종 모호한 것에 초점을 맞추고, 사람들이 실제로 중요하게 여기는 작업에서의 AI 성능을 제대로 반영하지 않는 점수로 나타난다는 점입니다.
Wharton의 교수인 Ethan Mollick은 X에서 더 나은 테스트와 이를 수행할 독립적인 단체가 필요하다고 말했습니다. 그는 AI 회사들이 종종 자체 벤치마크 결과를 보고하기 때문에 이를 완전히 신뢰하기 어렵다고 지적했습니다.
"공공 벤치마크는 '그저 그렇다'고 할 수 있으며, 포화 상태에 있어 AI 테스트는 음식 리뷰처럼 취향에 기반한 경우가 많습니다,"라고 Mollick은 썼습니다. "AI가 업무에 중요하다면, 더 많은 것이 필요합니다."
AI를 위한 새로운 벤치마크를 만들려는 사람들이 많지만, 무엇이 최선인지에 대한 합의는 없습니다. 일부는 벤치마크가 유용하려면 경제적 영향에 초점을 맞춰야 한다고 생각하고, 다른 이들은 실세계에서의 채택과 유용성이 성공의 진정한 척도라고 믿습니다.
이 논쟁은 영원히 계속될 수 있습니다. 아마도 X 사용자 Roon이 제안한 것처럼, 새로운 모델과 벤치마크에 덜 신경 쓰고, 주요 AI 돌파구가 있을 때까지 기다리는 것이 정신 건강에 더 좋을지도 모릅니다. 비록 그로 인해 일부 AI 과대 광고를 놓치더라도 말입니다.
앞서 언급했듯이, This Week in AI는 휴식을 취합니다. 독자 여러분, 모든 기복을 함께해 주셔서 감사합니다. 다음에 만나요.
뉴스

OpenAI의 전 CTO인 Mira Murati는 Thinking Machines Lab이라는 새로운 스타트업을 설립했습니다. 그들은 "[사람들의 고유한 필요와 목표]를 위한 AI 작업"을 만드는 도구를 개발 중입니다.
xAI는 Grok 3를 출시하고 iOS와 웹용 Grok 앱에 새로운 기능을 추가했습니다.
Meta는 올봄 첫 번째 생성 AI 중심 개발자 컨퍼런스를 개최합니다. Llama 모델의 이름을 딴 LlamaCon으로, 4월 29일에 열립니다.
Paul은 약 20개 조직이 참여한 OpenEuroLLM 프로젝트에 대해 썼습니다. 이 프로젝트는 모든 EU 언어의 "언어적, 문화적 다양성"을 존중하는 "유럽의 투명한 AI"를 위한 기반 모델을 구축하는 것입니다.
이번 주의 연구 논문

OpenAI는 최고 성능 모델인 Anthropic의 Claude 3.5 Sonnet이 전체 SWE-Lancer 벤치마크에서 40.3%만 기록했다고 밝혔으며, 이는 AI가 아직 갈 길이 멀다는 것을 보여줍니다. 그들은 OpenAI의 o3-mini나 중국의 DeepSeek의 R1 같은 최신 모델은 테스트하지 않았습니다.
이번 주의 모델
Stepfun이라는 중국 AI 회사가 중국어, 영어, 일본어로 음성을 이해하고 생성할 수 있는 "오픈" AI 모델 Step-Audio를 출시했습니다. 사용자는 합성 오디오의 감정과 방언, 심지어 노래까지 조정할 수 있습니다.
Stepfun은 관대한 라이선스로 모델을 출시하는 잘 자금 지원받는 중국 AI 스타트업 중 하나입니다. 2023년에 설립된 이들은 최근 중국 국영 사모펀드 투자자들로부터 수억 달러 규모의 펀딩 라운드를 마무리했습니다.
잡다한 소식

그들의 모델 DeepHermes-3 Preview는 정확성과 계산 능력을 균형 있게 유지하기 위해 짧고 긴 "사고의 연쇄"를 전환할 수 있습니다. "추론" 모드에서는 더 어려운 문제를 해결하는 데 시간이 더 걸리며, 그 과정에서 사고 과정을 보여줍니다.
Anthropic은 곧 비슷한 모델을 출시할 계획이라고 하며, OpenAI도 단기 로드맵에 있다고 밝혔습니다.
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.
AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.
AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?
AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔
AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐





집






