Liquid AI开源d1决策模型 支持图像输入
Liquid AI于10月7日发布d1系列两款开放权重决策模型,d1-3B以31.2亿参数支持文本与图像判断,d1-omni-600M以5.87亿参数支持文本、图像及语音输入,两款模型已在Hugging Face公开。
驱动中国10月9日消息,Liquid AI于10月7日发布博文,宣布推出d1系列两款开放权重决策模型。该系列包含d1-3B与d1-omni-600M,前者以31.2亿参数支持文本与图像判断,后者以5.87亿参数支持文本、图像及语音输入,两款模型已在Hugging Face公开,用户可下载、微调并部署。
在Jev模型于9月推出并引发关注后,OpenAI等公司相继推出类似决策模型,Liquid AI由此加入这一领域。本次发布的d1-3B基于视觉语言模型LFM2.5-VL-3B训练,支持文本与图像输入;该模型在Decision Index v0.2.1公开测试集上获得48.57分,Liquid AI称其领先所有10B以下模型。
d1-omni-600M基于双向编码器LFM2.5-Encoder-350M训练,支持文本与图像,或文本与语音的组合输入。该模型被描述为Liquid AI首个实验性多模态决策模型检查点。
推理速度方面,d1-3B在NVIDIA RTX 4090上回答单个问题耗时8毫秒,处理384像素图像耗时102毫秒;在Jetson AGX Thor上单问耗时16毫秒,在Jetson Orin Nano上为50毫秒。用户测试显示,该模型在12GB显存的GeForce RTX 3060上单次判断耗时25毫秒,处理640×480像素图像耗时146毫秒,峰值显存占用约6GB。另有用户报告称,d1-3B在RTX 3090上单次判断耗时8毫秒。