欧洲数字主权路线图中包含的开源LLM

上周,欧洲的数字主权议程因一项新举措的宣布而获得显著推动,该举措旨在开发一系列完全开源的大型语言模型(LLM),覆盖所有欧盟语言。这一雄心勃勃的项目,名为OpenEuroLLM,不仅针对24种欧盟官方语言,还扩展到正在谈判加入欧盟的国家(如阿尔巴尼亚)的语言,强调未来保障。
OpenEuroLLM是一个由大约20个组织协作的项目,由布拉格查理大学的计算语言学家Jan Hajič和芬兰AI实验室Silo AI的首席执行官兼联合创始人Peter Sarlin共同领导,Silo AI去年被AMD以6.65亿美元收购。该举措与欧洲推动数字主权的更广泛目标一致,旨在将关键基础设施和工具保留在欧洲大陆。这一行动与主要云提供商和AI公司(如OpenAI)的举措相呼应,这些公司一直在投资本地基础设施,以确保欧盟数据留在欧洲土壤上。
此外,欧盟最近签署了一项110亿美元的协议,建立主权卫星星座,定位为埃隆·马斯克的Starlink的竞争者。OpenEuroLLM完美契合这一叙事,专注于维护欧洲的技术自主权。
资金与挑战
尽管目标雄心勃勃,用于开发模型的预算为3740万欧元,其中约2000万欧元来自欧盟的数字欧洲计划。这一金额与企业AI巨头的投资相比显得微不足道,尽管考虑相关工作的资金后总预算有所增加。计算能力是一项重大开支,OpenEuroLLM与西班牙、意大利、芬兰和荷兰的EuroHPC超级计算机中心合作,这些中心是70亿欧元更广泛EuroHPC项目的一部分。
参与者群体多样,从学术界到企业,引发了关于项目可行性的疑问。LLM公司Pleias的联合创始人Anastasia Stasenko对如此大型联合体的有效性表示怀疑,认为相比之下,Mistral AI和LightOn等更敏捷、专注的私人AI公司具有更直接的责任感,能更快应对挑战。
从零开始还是利用现有成果?
OpenEuroLLM的起点有些模糊。自2022年以来,Jan Hajič一直在协调高性能语言技术(HPLT)项目,专注于使用高性能计算开发免费且可重复使用的数据集、模型和工作流程。该项目将于2025年底结束,与OpenEuroLLM共享许多合作伙伴,英国的除外。
Hajič将HPLT视为OpenEuroLLM的前身,认为它在数据、专业知识、工具和计算经验方面提供了坚实基础。他预计到2026年中发布OpenEuroLLM的首个版本,项目预计于2028年结束时发布最终版本。然而,项目的GitHub页面仍然内容稀疏,表明在某些方面是从零开始。Hajič提到,项目于2024年2月1日正式启动,此前准备了一年。
OpenEuroLLM联合体包括来自捷克、荷兰、德国、瑞典、芬兰和挪威的组织,以及Silo AI、Aleph Alpha、Ellamind、Prompsit Language Engineering和LightOn等企业实体。值得注意的是,尽管Hajič试图与法国AI独角兽Mistral进行讨论,但Mistral并未参与。
目标与交付成果
项目的主要目标是为欧洲的透明AI创建一系列基础模型,保留所有欧盟语言(当前和未来)的语言和文化多样性。交付成果仍在最终确定中,但预计包括用于通用任务的核心多语言LLM,以及为边缘应用优化的更小、量化版本,效率是关键。
Hajič强调了质量的重要性,表示鉴于高风险和公共资金的参与,项目旨在避免发布不成熟的解决方案。在数字资源有限的语言上实现同等熟练度仍是一个挑战。项目计划使用能准确代表这些语言和文化的基准。
来自HPLT项目的数据,包括从网络爬取的4.5拍字节数据集和超过200亿份文档,将被使用,并补充来自Common Crawl的数据。
开源困境
关于AI中“开源”定义的争论仍在继续。开源倡议(OSI)已定义了“开源AI”,但一些人认为它不仅应包括模型,还应包括数据集、预训练模型和权重。OpenEuroLLM旨在实现“真正开源”,但Hajič承认,由于欧洲版权法和数据重新分发的限制,可能存在局限性。一些训练数据可能需要保密,但根据欧盟AI法案可供审计。
与现有项目的重叠
OpenEuroLLM的推出引发了与最近推出的EuroLLM的比较,后者目标相似,也由欧盟共同资助。EuroLLM在9月发布了首个模型,12月发布了后续模型,引发了关于冗余和协作而非竞争的必要性的担忧。Unbabel研究负责人Andre Martins在社交媒体上强调了这些相似之处,呼吁不同社区之间进行开放协作。
Hajič承认这种重叠令人遗憾,但表示希望合作,指出OpenEuroLLM的资金限制了与非欧盟实体(包括英国大学)的合作。
资金与期望
中国DeepSeek的出现以其出色的性价比引发了关于构建AI模型真实成本的疑问。OpenEuroLLM的技术联合负责人Peter Sarlin指出,DeepSeek的开发细节信息不足,但他对OpenEuroLLM的资金充满信心,主要用于人员成本。计算费用预计由EuroHPC中心承担。
Sarlin强调,OpenEuroLLM的目标不是创建消费者或企业产品,而是为欧洲公司提供开源基础模型作为AI基础设施。他认为分配的预算足以实现这一目标,基于他在Silo AI的经验,该公司已开发支持多种欧洲语言的模型,并准备推出覆盖所有欧洲语言的“Europa”模型。
数字主权与协作
尽管面临挑战和批评,Hajič对OpenEuroLLM等协作项目的潜力保持乐观。他认为,结合学术专长和企业专注可能带来创新成果。最终目标不是与大型科技公司或数十亿美元的AI初创公司竞争,而是通过开发由欧洲为欧洲构建的基础LLM来增强欧洲的数字主权。
即使OpenEuroLLM未产生性能最佳的模型,Hajič认为拥有一个完全基于欧洲的“良好”模型仍有价值,为欧洲大陆的技术自主权作出积极贡献。
相关文章
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (23)
0/500
A bold plan, but the practicality worries me. Training LLMs for dozens of languages with nuanced cultural contexts sounds massively resource-intensive. Can this truly compete with existing centralized models, or will it be more of a symbolic sovereignty project?
Iniciativa bacana, mas será que a Europa vai conseguir acompanhar o ritmo de IA quando o foco é espalhar os recursos por tantos idiomas? 🤔 Pode ficar defasado antes de ficar pronto...
欧洲在AI基础设施上的自主布局确实明智,开源大语言模型能降低对单一技术供应商的依赖,不过资金和人才招募可能会是现实挑战。希望这个OpenEuroLLM项目能真正考虑小语种使用者的需求,而不仅仅是英法德这些主流语言 🌍
¡Vaya, esto sí es interesante! Un modelo de IA europeo y de código abierto... ¿Será la respuesta a la dependencia tecnológica que tenemos con EE.UU. y China? Me pregunto si realmente tendrá la misma potencia que los modelos cerrados de las grandes empresas. 🤔 Si logran cubrir todos los idiomas de la UE, sería un logro enorme para la diversidad cultural digital. ¡Ojalá vaya más allá de lo político y tenga un impacto real! 😊

上周,欧洲的数字主权议程因一项新举措的宣布而获得显著推动,该举措旨在开发一系列完全开源的大型语言模型(LLM),覆盖所有欧盟语言。这一雄心勃勃的项目,名为OpenEuroLLM,不仅针对24种欧盟官方语言,还扩展到正在谈判加入欧盟的国家(如阿尔巴尼亚)的语言,强调未来保障。
OpenEuroLLM是一个由大约20个组织协作的项目,由布拉格查理大学的计算语言学家Jan Hajič和芬兰AI实验室Silo AI的首席执行官兼联合创始人Peter Sarlin共同领导,Silo AI去年被AMD以6.65亿美元收购。该举措与欧洲推动数字主权的更广泛目标一致,旨在将关键基础设施和工具保留在欧洲大陆。这一行动与主要云提供商和AI公司(如OpenAI)的举措相呼应,这些公司一直在投资本地基础设施,以确保欧盟数据留在欧洲土壤上。
此外,欧盟最近签署了一项110亿美元的协议,建立主权卫星星座,定位为埃隆·马斯克的Starlink的竞争者。OpenEuroLLM完美契合这一叙事,专注于维护欧洲的技术自主权。
资金与挑战
尽管目标雄心勃勃,用于开发模型的预算为3740万欧元,其中约2000万欧元来自欧盟的数字欧洲计划。这一金额与企业AI巨头的投资相比显得微不足道,尽管考虑相关工作的资金后总预算有所增加。计算能力是一项重大开支,OpenEuroLLM与西班牙、意大利、芬兰和荷兰的EuroHPC超级计算机中心合作,这些中心是70亿欧元更广泛EuroHPC项目的一部分。
参与者群体多样,从学术界到企业,引发了关于项目可行性的疑问。LLM公司Pleias的联合创始人Anastasia Stasenko对如此大型联合体的有效性表示怀疑,认为相比之下,Mistral AI和LightOn等更敏捷、专注的私人AI公司具有更直接的责任感,能更快应对挑战。
从零开始还是利用现有成果?
OpenEuroLLM的起点有些模糊。自2022年以来,Jan Hajič一直在协调高性能语言技术(HPLT)项目,专注于使用高性能计算开发免费且可重复使用的数据集、模型和工作流程。该项目将于2025年底结束,与OpenEuroLLM共享许多合作伙伴,英国的除外。
Hajič将HPLT视为OpenEuroLLM的前身,认为它在数据、专业知识、工具和计算经验方面提供了坚实基础。他预计到2026年中发布OpenEuroLLM的首个版本,项目预计于2028年结束时发布最终版本。然而,项目的GitHub页面仍然内容稀疏,表明在某些方面是从零开始。Hajič提到,项目于2024年2月1日正式启动,此前准备了一年。
OpenEuroLLM联合体包括来自捷克、荷兰、德国、瑞典、芬兰和挪威的组织,以及Silo AI、Aleph Alpha、Ellamind、Prompsit Language Engineering和LightOn等企业实体。值得注意的是,尽管Hajič试图与法国AI独角兽Mistral进行讨论,但Mistral并未参与。
目标与交付成果
项目的主要目标是为欧洲的透明AI创建一系列基础模型,保留所有欧盟语言(当前和未来)的语言和文化多样性。交付成果仍在最终确定中,但预计包括用于通用任务的核心多语言LLM,以及为边缘应用优化的更小、量化版本,效率是关键。
Hajič强调了质量的重要性,表示鉴于高风险和公共资金的参与,项目旨在避免发布不成熟的解决方案。在数字资源有限的语言上实现同等熟练度仍是一个挑战。项目计划使用能准确代表这些语言和文化的基准。
来自HPLT项目的数据,包括从网络爬取的4.5拍字节数据集和超过200亿份文档,将被使用,并补充来自Common Crawl的数据。
开源困境
关于AI中“开源”定义的争论仍在继续。开源倡议(OSI)已定义了“开源AI”,但一些人认为它不仅应包括模型,还应包括数据集、预训练模型和权重。OpenEuroLLM旨在实现“真正开源”,但Hajič承认,由于欧洲版权法和数据重新分发的限制,可能存在局限性。一些训练数据可能需要保密,但根据欧盟AI法案可供审计。
与现有项目的重叠
OpenEuroLLM的推出引发了与最近推出的EuroLLM的比较,后者目标相似,也由欧盟共同资助。EuroLLM在9月发布了首个模型,12月发布了后续模型,引发了关于冗余和协作而非竞争的必要性的担忧。Unbabel研究负责人Andre Martins在社交媒体上强调了这些相似之处,呼吁不同社区之间进行开放协作。
Hajič承认这种重叠令人遗憾,但表示希望合作,指出OpenEuroLLM的资金限制了与非欧盟实体(包括英国大学)的合作。
资金与期望
中国DeepSeek的出现以其出色的性价比引发了关于构建AI模型真实成本的疑问。OpenEuroLLM的技术联合负责人Peter Sarlin指出,DeepSeek的开发细节信息不足,但他对OpenEuroLLM的资金充满信心,主要用于人员成本。计算费用预计由EuroHPC中心承担。
Sarlin强调,OpenEuroLLM的目标不是创建消费者或企业产品,而是为欧洲公司提供开源基础模型作为AI基础设施。他认为分配的预算足以实现这一目标,基于他在Silo AI的经验,该公司已开发支持多种欧洲语言的模型,并准备推出覆盖所有欧洲语言的“Europa”模型。
数字主权与协作
尽管面临挑战和批评,Hajič对OpenEuroLLM等协作项目的潜力保持乐观。他认为,结合学术专长和企业专注可能带来创新成果。最终目标不是与大型科技公司或数十亿美元的AI初创公司竞争,而是通过开发由欧洲为欧洲构建的基础LLM来增强欧洲的数字主权。
即使OpenEuroLLM未产生性能最佳的模型,Hajič认为拥有一个完全基于欧洲的“良好”模型仍有价值,为欧洲大陆的技术自主权作出积极贡献。
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
A bold plan, but the practicality worries me. Training LLMs for dozens of languages with nuanced cultural contexts sounds massively resource-intensive. Can this truly compete with existing centralized models, or will it be more of a symbolic sovereignty project?
Iniciativa bacana, mas será que a Europa vai conseguir acompanhar o ritmo de IA quando o foco é espalhar os recursos por tantos idiomas? 🤔 Pode ficar defasado antes de ficar pronto...
欧洲在AI基础设施上的自主布局确实明智,开源大语言模型能降低对单一技术供应商的依赖,不过资金和人才招募可能会是现实挑战。希望这个OpenEuroLLM项目能真正考虑小语种使用者的需求,而不仅仅是英法德这些主流语言 🌍
¡Vaya, esto sí es interesante! Un modelo de IA europeo y de código abierto... ¿Será la respuesta a la dependencia tecnológica que tenemos con EE.UU. y China? Me pregunto si realmente tendrá la misma potencia que los modelos cerrados de las grandes empresas. 🤔 Si logran cubrir todos los idiomas de la UE, sería un logro enorme para la diversidad cultural digital. ¡Ojalá vaya más allá de lo político y tenga un impacto real! 😊





首页






