葡萄牙以700万欧元推出开放大语言模型Amália,法国仍在争论AI主权
Mistral AI
Meta
Hugging Face
2026年7月1日,葡萄牙正式发布了Amália,称其为首个以欧洲葡萄牙语开发的开放大语言模型。该模型由复苏与韧性计划资助,公共投资达700万欧元,通过改编现有开放模型并利用欧洲共享计算基础设施构建而成。这与法国形成鲜明对比,法国尽管拥有全球领先的Mistral AI和公共超级计算机,却尚未推出国家级的公共语言模型。
2026年7月1日,葡萄牙政府发布了名为“阿玛利亚”的大语言模型,并称之为首个以欧洲葡萄牙语开发的开放大语言模型。该项目由里斯本新大学协调,联合其他高校和研究中心,动员了60多名研究人员,并得到恢复与韧性计划的资助,到2027年公共投资将达700万欧元。该模型已在Hugging Face上以Apache 2.0许可证发布。阿玛利亚并非单一系统,而是一组模型:一个90亿参数文本模型、一个视觉模型和一个语音识别组件。文本模型基于现有的开放模型构建,特别是EuroLLM-9B和GlorIA,扩展了EuroLLM的预训练以改进欧洲葡萄牙语知识,并将上下文窗口增加到32000个标记。这种方法成本远低于从头训练。类似策略已在欧洲其他地方使用,如巴斯克语的Latxa、西班牙的ALIA、德国的Teuken-7B和欧盟的OpenEuroLLM项目。相比之下,法国拥有Mistral AI(一家私营公司)和Albert(一个为第三方开放模型服务的国家基础设施),但没有公开训练的国内语言模型,尽管此前有BLOOM等尝试。阿玛利亚存在局限性:它是现有基础模型的改编,且参数规模仅90亿,远不及美国或中国的一流系统。尽管如此,它证明了通过大学联盟、欧洲资金和共享计算基础设施,可以实现面向某种语言的自主开放大语言模型。
来源: ActuIA —
原文
