惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
A
About on SuperTechFans
小众软件
小众软件
Hugging Face - Blog
Hugging Face - Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 叶小钗
博客园 - 聂微东
博客园 - Franky
Apple Machine Learning Research
Apple Machine Learning Research
罗磊的独立博客
量子位
博客园 - 三生石上(FineUI控件)
Recent Announcements
Recent Announcements
The GitHub Blog
The GitHub Blog
B
Blog RSS Feed
T
The Blog of Author Tim Ferriss
GbyAI
GbyAI
云风的 BLOG
云风的 BLOG
Last Week in AI
Last Week in AI
宝玉的分享
宝玉的分享
B
Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Stack Overflow Blog
Stack Overflow Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
如何设计一款有温度的AI产品?(三)
是伯男呀 · 2024-02-19 · via 人人都是产品经理

在前面,作者介绍了自己在设计一款“有温度”的AI产品的历程和感悟,这里,作者接着做出阐述,并对实时Agent发表了自己的一些看法,一起来看看吧。

接上文:

两个小家伙天天活力无限,抱歉拖更有点严重,祝大家新年新活力,岁岁福满堂。

一、和大家汇报下亲音AI这款产品的进展

做这个产品的初衷,通过AI科技的途径,见到已逝的心心念念之人,弥补心里的遗憾,也让AI变成有温度的科技,而不是冷冰冰商业变现或是人力的替代,目前初版产品已经研发完成了,将实时的Taking Head转换成文字方式,1.5版本会将实时视频放出来(WIFI环境下实时延迟5秒以内)。

发展方面,也有几个投资人想要对这个产品进行投资,我还是想保持下初心,让我的两个孩子看看他们没有见过的爷爷,投资的事项我可能要放后面一点,在另外一个实时Agent + RPA的项目上商业化,这个产品还是单纯的自私一点。

二、1.4版本的产品设计相关

想来想去,还是V信是最习惯的沟通交互,所以你懂的像素级Copy(这被设计师朋友作为了一生的耻辱,已经和我断交了,设计了九个版本从0.5到1.4,最后改回了最初的交互,他说以后连眼神都不会和我进行交流…)。

三、几个版本的设计理念

1.4的版本设计中,智能体Agent可以主动的和人进行交流,图片,语音,文字,视频都会主动的进行发送,当然这些还是基于规则层面的,还没有达到一个智能体Agent该有的高度(能感知环境,感知交流人的情绪,安抚并善于沟通,独立推理思考这些),近期也会发布到应用市场。

1.5版本中,会加入基于RAD-NERF的实时视频相关的能力,这个改动会相对大一些,1.5版本才是我最最想要的东西,所有的思考都是源于可视化的实时交流。

1.6版本中,会将采用AI Agent框架重写下,当前智能体的交流方式,从被动Prompt,到主动使用摄像头感知交流者的情绪、当前环境,为智能体创造一个可以生存的虚拟灵域,这个并不是天方夜谭,一个微模型的环境中,有人类所需要各种设施,智能体可以生活中这个小镇中,彼此可以交流并保持长期记忆,每一次的沟通智能体都会更像自己的心心念念之人。

四、实时Agent的一些思考和技术实现

目前采用的是基于RAD-NERF的低纬特征进行音频面部驱动的,说实话论文的中的理论部分没看懂,好多公式还得先Google下才能稍稍理解。

通俗来讲就是根据一段视频,先分离音频,将视频分为一帧一帧的图像,然后通过3DMM等模型分割人像,加入背景图片进行头部、唇部、身体部分训练得到训练好的人物模型,最后通过文字转语音驱动当前的任务进行Talking head,实时将每一帧推送给需要的播放端,所以对产品的挑战就是,需要有人物的声音,视频,作为训练素材,背景不能有杂音,视频动作需要有规范。

一些改进的思考,首先speech to text耗时有一些,目前一些模型也支持,语音生成语音openai 或是达摩院的一些产品,可以省去音频转换部分的IO消耗及网络相关的耗时,推流部分应该前后有衔接动作或是语音的暂停1-2秒,更好的衔接,还有就是虚机配显卡的环境适合测试,真正使用还是需要物理机,推理性能提高10%以上,还是有很大帮助的,这部分我会单独发布下包括后面的源码。

最后,还是保持初心,科技是生活的一部分,不是全部,身边的人是最需要关注的。

未完待续。

本文由 @AI李伯男 原创发布于人人都是产品经理,未经许可,禁止转载。

题图来自 Unsplash,基于 CC0 协议。

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。