NASA将谷歌Gemma 3语言模型送入轨道
Google/DeepMind
NVIDIA
Loft Orbital
美国国家航空航天局(NASA)喷气推进实验室完成了谷歌视觉语言模型Gemma 3的首次在轨演示,该模型用于分析卫星传感器图像。NAVI-Orbital系统运行压缩的4位版本模型,在无专门训练的情况下实现了88%的图像分类准确率。
NASA喷气推进实验室(Jet Propulsion Laboratory)已将Google Gemma 3模型送入轨道,首次展示了视觉语言模型直接在太空中分析卫星传感器图像的能力。该系统名为NAVI-Orbital,利用Gemma 3分析由Loft Orbital公司制造的YAM-9卫星摄像头捕获的图像。NAVI-Orbital是一个智能软件框架,由NASA JPL的Juan M. Delfa、Taran Cyriac John以及Loft Orbital的Andrew W. Herson共同开发。它通过基于LangGraph的协调器来管理操作,并部署了压缩后的4位版本Gemma 3 4B开源模型,该模型可生成图像的文本描述。在包含7960张图像的基准测试集上,系统实现了88%的分类准确率,而模型并未专门针对该数据集进行训练。进入轨道后,研究人员进行了两次实拍测试:分别针对法国图卢兹和阿根廷海岸。Gemma 3运行在Nvidia Jetson Orin AGX计算模块上,该模块功耗为150至500瓦,由卫星的太阳能板供电。Loft Orbital总经理Paul Lasserre表示,视觉大语言模型(vision-LLM)可通过“语义压缩”(即以文本摘要代替大量原始数据)为轨道运行带来“范式转变”,这在通信带宽受限时尤为重要。未来,此类技术有望加速火灾或其他事件的检测,并成为宇航员通过自然语言与航天器系统交互的基础。
来源: IEEE Spectrum AI —
原文
