惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Schneier on Security
Schneier on Security
N
Netflix TechBlog - Medium
IT之家
IT之家
MongoDB | Blog
MongoDB | Blog
博客园_首页
S
SegmentFault 最新的问题
H
Help Net Security
P
Proofpoint News Feed
云风的 BLOG
云风的 BLOG
T
The Blog of Author Tim Ferriss
量子位
GbyAI
GbyAI
M
MIT News - Artificial intelligence
Recorded Future
Recorded Future
P
Privacy & Cybersecurity Law Blog
B
Blog
月光博客
月光博客
博客园 - 聂微东
Vercel News
Vercel News
罗磊的独立博客
腾讯CDC
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
A
Arctic Wolf
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Stack Overflow Blog
Stack Overflow Blog
T
Threat Research - Cisco Blogs
Blog — PlanetScale
Blog — PlanetScale
L
Lohrmann on Cybersecurity
I
Intezer
小众软件
小众软件
T
The Exploit Database - CXSecurity.com
Jina AI
Jina AI
C
Check Point Blog
AWS News Blog
AWS News Blog
C
Cisco Blogs
Martin Fowler
Martin Fowler
The Last Watchdog
The Last Watchdog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
宝玉的分享
宝玉的分享
S
Security Affairs
大猫的无限游戏
大猫的无限游戏
N
News and Events Feed by Topic
雷峰网
雷峰网
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
H
Hacker News: Front Page
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
F
Full Disclosure
P
Proofpoint News Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Microsoft Security Blog
Microsoft Security Blog

GbyAI

企微、个微机器人调研 AIPM角度对于deepseek-r1的解读 Claude MCP 小示例以及一些想法 comfyui官方桌面版V1尝鲜 Creating a LLM-as-a-Judge That Drives Business Results LLM经典paper傻瓜式速读(持续更新) o1 AI瞎想碎片化思考系列之agent构建 我常用的极品提示词hhh 分享平时觉得比较好用的RSS订阅&&一键导入目前我订阅的源 linkedin 做 agent 的一些建议 现阶段做智能客服 agent 的复盘(持续补充) AIPM技能树 ToC端医美AI伴侣产品-简述(一期) LLM越来越长上下文的一些简单思考 有关 Sora 的一些思考和理解 汇总26个提示词工程技巧 读《人工智能 agent 勘测多模态交互的前景》 读《王慧文清华产品课》 LLM 智能客服 PK 传统智能客服 李想产品实战16讲 自用稳定快速ChatGPT VPN 使用 API 和 Node 创建带有复杂后端逻辑的 GPTs(译) 手递手教你 Obsidian 笔记建站 如何使用虚拟卡升级 Chatgpt Plus 和 Api OpenAI Translator 介绍 + 两个中英互译 Prompt 医美垂直领域智能客服agent搭建说明书(万字长文) 友情免费提供使用 ChatGPT py 自动抓取微信群消息 关于我 友链
浅析AutoGLM
hellloveyy · 2024-10-29 · via GbyAI

GCC 进化史

API 层面调用 > RPA 固定工作流 > 视觉模型推理

API 层面:基本不可能哈哈,能做也是像支小宝这种,大厂直接入场。第三方开发者指望微信、支付宝等软件开放 API 基本不现实。当然也有部分开放的 API, 大概能实现的场景和 OpenAI 之前演示的差不多,是有很大局限的。

RPA 固定流程:类似影刀等。内部小 team 也一直在研究 RPA 的流程(Sonic 云真机)针对小红书等大流量平台,做起号、截留评论等。RPA 确实稳定,但是不灵活,兼容性较差。

视觉模型推理:荣耀手机、智谱的 AutoGLM,我理解是 AI 对 RPA 的升级版。通过手机系统级别的 无障碍服务(AccessibilityService) 和 OCR 提供视觉推理与操作。

GCC 概念

以下为 AIPM 技能树文档整理有关 GCC 的截图:

我认为的 GCC = LLM 分析 LUI 输入形成拟人化流程(大脑) + 界面内容识别模型(眼) + 多 Agent 判别(Tools 调用)+ 最终操作程序(手)

画个简图↓

借着 AutoGLM 这个产品逐步分析一下

输入

LUI 作为输入端,目前来看无论 computer use 还是 phone use 基本上都是文本+语音的模式了,这个没什么可聊的。

模型处理

其实这部分接收三种类型的输入:

  1. 模型处理不光需要理解用户输入,还需要输出指定的工作流
  2. 根据界面内容识别,目前所处的阶段以及分析页面可操作部分
  3. 操作之后的内容识别,用来佐证操作是否正确,以进行下一步流程

我理解这部分的模型不只是大语言模型,也包括了一系列类似 MOE 的专家模型,针对不同的 APP 内容做专属的微调。

这也是目前只支持这 8 个 APP 的部分原因。

决策

这一部分决定了会在这 8 个 APP 中启用哪个 agent,一个 agent 代表一个 APP,目前只支持单个 agent 的操作,但是后续绝对会支持跨 APP 的 muilt-agent。

每一个 agent 中又包含了 tools 的使用,例如留言、查找等。

大脑作为统一中枢,根据决策去调用和共享信息。

同时决策也会根据大脑的工作流,一步步的引导操作和视觉识别。

界面内容识别

巧的是在 AutoGLM 推出不久,微软就开源了 OmniParser 作为界面内容识别的能力。这一块才是最重点的内容,真正做到非标准流程的标准!

最终操作

这块最简单 ui automator 等类似的软件都实现过,不过目前是结合界面内容识别来实现点击、拖拽等操作。

附:AutoGLM 内部使用手册: https://zhipu-ai.feishu.cn/wiki/Xxn8wPVdKiZQ2ukGdrqcRsHjnFg