10月10日,据报道,Liquid AI 推出了 d1 系列两款开放权重决策模型,分别是支持 31.2 亿参数文本与图像判断的 d1-3B,以及以 5.87 亿参数支持文本、图像及语音输入的 d1-omni-600M。

在 Jev 模型 9 月走红之后,OpenAI 等公司也相继推出类似的决策模型,Liquid AI 是加入这场竞争的新成员。这次发布的 d1-3B 与 d1-omni-600M 都已经在 Hugging Face 公开,用户可以下载、微调并部署。
从参数上看,d1-3B 基于视觉语言模型 LFM2.5-VL-3B 训练,在 Decision Index v0.2.1 公开测试集拿到 48.57 分,Liquid AI 称它领先所有 10B 以下模型。d1-omni-600M 则基于双向编码器 LFM2.5-Encoder-350M 训练,支持文本加图像、或文本加语音的组合输入,属于 Liquid AI 首个实验性的多模态决策模型检查点。
推理速度是这代模型的亮点。d1-3B 在 NVIDIA RTX 4090 上回答单个问题只要 8 毫秒,处理 384 像素图像约 102 毫秒;在 Jetson AGX Thor 上单问 16 毫秒,在 Jetson Orin Nano 上为 50 毫秒。用户实测还显示,它在 12GB 显存的 RTX 3060 上单次判断 25 毫秒、处理 640×480 图像 146 毫秒,峰值显存占用约 6GB;在 RTX 3090 上单次判断同样能压到 8 毫秒。
原创文章,作者:苹果派,如若转载,请注明出处:https://www.kejixun.co/article/764208.html