惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园_首页
Microsoft Azure Blog
Microsoft Azure Blog
aimingoo的专栏
aimingoo的专栏
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
阮一峰的网络日志
阮一峰的网络日志
Martin Fowler
Martin Fowler
B
Blog
The GitHub Blog
The GitHub Blog
T
Tailwind CSS Blog
Stack Overflow Blog
Stack Overflow Blog
L
LangChain Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
D
DataBreaches.Net
月光博客
月光博客
人人都是产品经理
人人都是产品经理
IT之家
IT之家
GbyAI
GbyAI
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
WordPress大学
WordPress大学
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
The Cloudflare Blog
C
Check Point Blog
罗磊的独立博客

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
谷歌开源FunctionGemma:2.7亿参数AI模型如何重塑手机语音助...
站外新闻 · 2026-06-14 · via Prompt 语宙

💡 站外导读:当前AI应用常停留在对话层面,用户需要的是能直接执行任务的智能体。谷歌开源FunctionGemma,旨在解决自然语言到API动作的转化瓶颈,让AI真正“能干活”。这标志着AI从被动响应向主动执行的关键转变,尤其适用于手机、IoT等端侧场景,提升效率并保护隐私。

FunctionGemma 是谷歌开源的专注于函数调用优化的轻量化AI模型,参数量为 2.7 亿。模型基于 Gemma 3 架构,专为在手机、浏览器等端侧设备上运行而设计,能将自然语言转化为可执行的 API 动作,实现智能体与工具的高效交互。模型具备强大的多步骤推理和任务执行能力,支持离线运行,广泛应用于手机语音助手、家庭自动化控制等场景,满足用户对 AI“能干活”的需求,推动 AI 从对话式接口向主动体的转变。

  • FunctionGemma是什么
  • FunctionGemma的主要功能
  • FunctionGemma的技术原理
  • FunctionGemma的项目地址
  • FunctionGemma的应用场景
      • 📝 站长洞察 (Editor’s Insight)

FunctionGemma

FunctionGemma的主要功能

  • 自然语言到函数调用的转换:将用户的自然语言指令转化为结构化的函数调用,例如将“明天早上 7 点叫醒我”转化为调用闹钟设置的 API 函数。

  • 多步骤任务执行:支持复杂的多步骤任务分解和执行,例如在指令“在顶排种满向日葵,然后给它们浇水”中,模型会将其分解为多个函数调用,依次执行种植和浇水的操作。

  • 本地化运行与隐私保护:专为端侧设备(如手机、IoT 设备)设计,支持在本地运行,无需联网,确保用户数据的隐私和低延迟响应。

  • 多语言支持:支持多种语言输入,能处理不同语言的指令并转化为相应的函数调用。

  • 定制化训练:提供微调工具,开发者能根据具体应用场景对模型进行定制化训练,进一步提升其在特定任务上的性能和可靠性。

  • 智能体交互:作为独立的智能体执行本地任务,也可以作为“智能路由器”,将复杂任务分发到云端或其他设备上的更大型模型中,实现高效的系统协同工作。

FunctionGemma的技术原理

  • 基于 Gemma 3 的架构优化:FunctionGemma 是在 Gemma 3 架构的基础上进行优化的轻量化模型。继承 Gemma 3 的高效解码器结构,针对函数调用任务进行专门的微调和优化。

  • 模型适配与微调:采用“模型适配”技术,将经过大规模预训练的 Gemma 3 模型权重映射到新的任务专用结构中。通过在特定数据集(如移动设备上的常见任务)上进行微调,模型能学习到精准的函数调用模式,在端侧任务中表现出色。

  • 结构化输出能力:模型经过训练,能生成结构化的数据(如 JSON 格式),数据能直接用于调用外部 API 或执行系统命令,实现自然语言与软件接口之间的无缝对接。

  • 端侧优化:为在资源受限的端侧设备上高效运行,FunctionGemma 进行多方面的优化,包括模型量化(如 Int8 或 Int4 量化)降低内存占用和功耗,和优化词汇表高效处理 JSON 和多语言输入。

FunctionGemma的项目地址

  • 项目官网:https://blog.google/technology/developers/functiongemma/
  • HuggingFace模型库:https://huggingface.co/collections/google/functiongemma

FunctionGemma的应用场景

  • 手机语音助手:集成到手机系统中,实现如设置提醒、控制手电筒、管理日程等本地任务的语音指令执行,提升交互效率。

  • 智能家居控制:作为智能家居中枢,通过语音指令控制灯光、温度等设备,或执行“睡眠模式”等场景化操作。

  • 游戏交互:用于语音控制游戏,如分解“种向日葵并浇水”等复杂指令为游戏函数调用,增强游戏互动性。

  • 移动办公应用:在移动办公场景中,通过语音指令完成邮件发送、文档编辑等任务,提高工作效率。

  • 健康与健身应用:集成到健康设备或健身应用中,记录健康数据、指导健身动作,提供个性化健康管理。

📝 站长洞察 (Editor’s Insight)

FunctionGemma的发布是谷歌在端侧AI智能体布局的关键一步,它精准切中了行业从对话式AI向行动式AI转型的趋势。通过将2.7亿参数模型优化至本地运行,谷歌解决了云端延迟和隐私顾虑,为手机助手、智能家居等场景提供了高效、可靠的函数调用能力。这不仅推动了AIGC向AIGA的演进,更预示着未来智能设备将更自主地执行复杂任务,成为用户真正的数字延伸。开发者应关注其微调工具,以在垂直领域挖掘更大价值。