跳到正文
千机 API

#端侧

今日 0 条
10月8日周四
  1. Hugging Face Blog

    Liquid AI 发布面向边缘设备的多模态决策模型 d1-3B 和 d1-omni-600M

    Liquid AI 发布两款开放权重决策模型 d1-3B 和 d1-omni-600M,分别支持文本与图像输入,以及文本与图像或文本与音频输入。d1-3B 在 Decision Index 0.2.1 得分为 48.57;在七项公开数据集上的平均得分为 82.9,d1-omni-600M 为 78.4。

    文章将模型规模、Decision Index 成绩与不同设备上的响应时间并列呈现,便于比较两款模型在决策质量、运行速度和部署场景上的取舍。

10月7日周三
  1. Google DeepMind

    Google DeepMind 发布 EmbeddingGemma 2 多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,面向端侧推理。模型有 740M 参数,采用 Apache 2.0 许可,并支持将输出向量从 768 维截断至 512、256 或 128 维。

    EmbeddingGemma 2 将文本、代码、图像、视频和音频映射到统一嵌入空间,并提供参数规模、内存占用与向量压缩信息,便于评估端侧多模态检索的部署取舍。

7月31日周五
  1. Google DeepMind

    Google DeepMind 发布 Gemini Robotics 2,推进机器人全身控制与协作

    Google DeepMind 发布 Gemini Robotics 2 系列,包含可将视觉和语言转为动作的全身控制模型、具身推理模型及端侧模型,支持灵巧操作、多步骤任务和多机器人协作。具身推理模型当时已在 Google AI Studio 开放,并于 Gemini Enterprise Agent Platform 私测;VLA 及端侧模型仅向早期合作伙伴提供,官方称机器人运动速度仍有提升空间。

12月11日周四
6月26日周四
  1. Hugging Face Blog

    Gemma 3n 发布并接入多种开源推理库

    Google 的 Gemma 3n 正式提供两个尺寸(E2B、E4B),各有 base 与 instruct 版本,并接入 Transformers、MLX、llama.cpp 等开源库;其中 llama.cpp 仅支持文本输入。模型支持文本、图像、音频和视频输入,实际参数量分别为 5B、8B,文章称其显存需求约为 2GB、3GB。文章还提到 E2B instruct 的 ONNX 权重已发布。

2月20日周四
10月16日周三
9月25日周三
  1. Hugging Face Blog

    Meta 发布 Llama 3.2:开放权重涵盖视觉与设备端小模型

    Meta 发布 Llama 3.2,Hugging Face 称系列中有十个开放权重模型,包括五个多模态模型和五个纯文本模型。视觉版提供 11B、90B 两种规模;1B、3B 文本模型面向设备端使用,支持 128K 上下文。文中注明,欧盟境内个人及主要营业地在欧盟的公司未获多模态模型许可,但使用这些模型的产品或服务终端用户不受此限制。