惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
News | PayPal Newsroom
IT之家
IT之家
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
大猫的无限游戏
大猫的无限游戏
GbyAI
GbyAI
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
L
LangChain Blog
S
SegmentFault 最新的问题
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
Project Zero
Project Zero
P
Privacy & Cybersecurity Law Blog
V
Vulnerabilities – Threatpost
博客园 - 三生石上(FineUI控件)
Recorded Future
Recorded Future
The Hacker News
The Hacker News
C
CXSECURITY Database RSS Feed - CXSecurity.com
C
CERT Recently Published Vulnerability Notes
宝玉的分享
宝玉的分享
aimingoo的专栏
aimingoo的专栏
T
Tor Project blog
T
The Exploit Database - CXSecurity.com
Schneier on Security
Schneier on Security
H
Help Net Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
M
MIT News - Artificial intelligence
W
WeLiveSecurity
P
Proofpoint News Feed
A
About on SuperTechFans
S
Securelist
I
InfoQ
G
Google Developers Blog
博客园 - 司徒正美
博客园 - 叶小钗
Latest news
Latest news
F
Fortinet All Blogs
G
GRAHAM CLULEY
腾讯CDC
Jina AI
Jina AI
S
Schneier on Security
I
Intezer
V
Visual Studio Blog
美团技术团队
V2EX - 技术
V2EX - 技术
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The Cloudflare Blog
Microsoft Security Blog
Microsoft Security Blog
Blog — PlanetScale
Blog — PlanetScale
P
Proofpoint News Feed
罗磊的独立博客
Y
Y Combinator Blog

GbyAI

企微、个微机器人调研 AIPM角度对于deepseek-r1的解读 Claude MCP 小示例以及一些想法 comfyui官方桌面版V1尝鲜 Creating a LLM-as-a-Judge That Drives Business Results LLM经典paper傻瓜式速读(持续更新) o1 AI瞎想碎片化思考系列之agent构建 我常用的极品提示词hhh 分享平时觉得比较好用的RSS订阅&&一键导入目前我订阅的源 linkedin 做 agent 的一些建议 现阶段做智能客服 agent 的复盘(持续补充) AIPM技能树 ToC端医美AI伴侣产品-简述(一期) LLM越来越长上下文的一些简单思考 有关 Sora 的一些思考和理解 汇总26个提示词工程技巧 读《人工智能 agent 勘测多模态交互的前景》 读《王慧文清华产品课》 LLM 智能客服 PK 传统智能客服 李想产品实战16讲 自用稳定快速ChatGPT VPN 使用 API 和 Node 创建带有复杂后端逻辑的 GPTs(译) 手递手教你 Obsidian 笔记建站 如何使用虚拟卡升级 Chatgpt Plus 和 Api OpenAI Translator 介绍 + 两个中英互译 Prompt 医美垂直领域智能客服agent搭建说明书(万字长文) 友情免费提供使用 ChatGPT py 自动抓取微信群消息 关于我 友链
浅析AutoGLM
hellloveyy · 2024-10-29 · via GbyAI

GCC 进化史

API 层面调用 > RPA 固定工作流 > 视觉模型推理

API 层面:基本不可能哈哈,能做也是像支小宝这种,大厂直接入场。第三方开发者指望微信、支付宝等软件开放 API 基本不现实。当然也有部分开放的 API, 大概能实现的场景和 OpenAI 之前演示的差不多,是有很大局限的。

RPA 固定流程:类似影刀等。内部小 team 也一直在研究 RPA 的流程(Sonic 云真机)针对小红书等大流量平台,做起号、截留评论等。RPA 确实稳定,但是不灵活,兼容性较差。

视觉模型推理:荣耀手机、智谱的 AutoGLM,我理解是 AI 对 RPA 的升级版。通过手机系统级别的 无障碍服务(AccessibilityService) 和 OCR 提供视觉推理与操作。

GCC 概念

以下为 AIPM 技能树文档整理有关 GCC 的截图:

我认为的 GCC = LLM 分析 LUI 输入形成拟人化流程(大脑) + 界面内容识别模型(眼) + 多 Agent 判别(Tools 调用)+ 最终操作程序(手)

画个简图↓

借着 AutoGLM 这个产品逐步分析一下

输入

LUI 作为输入端,目前来看无论 computer use 还是 phone use 基本上都是文本+语音的模式了,这个没什么可聊的。

模型处理

其实这部分接收三种类型的输入:

  1. 模型处理不光需要理解用户输入,还需要输出指定的工作流
  2. 根据界面内容识别,目前所处的阶段以及分析页面可操作部分
  3. 操作之后的内容识别,用来佐证操作是否正确,以进行下一步流程

我理解这部分的模型不只是大语言模型,也包括了一系列类似 MOE 的专家模型,针对不同的 APP 内容做专属的微调。

这也是目前只支持这 8 个 APP 的部分原因。

决策

这一部分决定了会在这 8 个 APP 中启用哪个 agent,一个 agent 代表一个 APP,目前只支持单个 agent 的操作,但是后续绝对会支持跨 APP 的 muilt-agent。

每一个 agent 中又包含了 tools 的使用,例如留言、查找等。

大脑作为统一中枢,根据决策去调用和共享信息。

同时决策也会根据大脑的工作流,一步步的引导操作和视觉识别。

界面内容识别

巧的是在 AutoGLM 推出不久,微软就开源了 OmniParser 作为界面内容识别的能力。这一块才是最重点的内容,真正做到非标准流程的标准!

最终操作

这块最简单 ui automator 等类似的软件都实现过,不过目前是结合界面内容识别来实现点击、拖拽等操作。

附:AutoGLM 内部使用手册: https://zhipu-ai.feishu.cn/wiki/Xxn8wPVdKiZQ2ukGdrqcRsHjnFg