惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
The Exploit Database - CXSecurity.com
C
Cyber Attacks, Cyber Crime and Cyber Security
Forbes - Security
Forbes - Security
The Last Watchdog
The Last Watchdog
F
Full Disclosure
GbyAI
GbyAI
G
Google Developers Blog
Security Archives - TechRepublic
Security Archives - TechRepublic
阮一峰的网络日志
阮一峰的网络日志
T
The Blog of Author Tim Ferriss
C
Check Point Blog
S
Security @ Cisco Blogs
H
Help Net Security
N
News | PayPal Newsroom
D
DataBreaches.Net
L
LINUX DO - 最新话题
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
U
Unit 42
WordPress大学
WordPress大学
月光博客
月光博客
Security Latest
Security Latest
V
V2EX
Schneier on Security
Schneier on Security
美团技术团队
Y
Y Combinator Blog
G
GRAHAM CLULEY
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
S
Securelist
The Cloudflare Blog
Engineering at Meta
Engineering at Meta
P
Proofpoint News Feed
O
OpenAI News
Cisco Talos Blog
Cisco Talos Blog
Martin Fowler
Martin Fowler
N
News and Events Feed by Topic
小众软件
小众软件
S
Schneier on Security
Webroot Blog
Webroot Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
V
Visual Studio Blog
T
Threatpost
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Scott Helme
Scott Helme
N
Netflix TechBlog - Medium
有赞技术团队
有赞技术团队
W
WeLiveSecurity
S
SegmentFault 最新的问题
Cloudbric
Cloudbric
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
M
MIT News - Artificial intelligence

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux - V2EX [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 新电脑 brew install node 之后,一个小设置可以提升对供应链投毒的防御 - V2EX GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? - V2EX 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? - V2EX gemini cli 貌似挂了,一直返回 403 - V2EX 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 - V2EX 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 - V2EX 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 - V2EX 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 - V2EX 只有我一个人觉得 codex 不好用? 做了个 AI + 真人专家监督的广告投放平台 Auxora, 7 个品牌跑出 6x ROAS 如何走出至亲的离世 Claude Web 端貌似 claude-opus-4-7 偷偷上了? 现在 Apple 开发者帳號應該是用哪个地区会更好? - V2EX 用回测筛选因子的一点经验分享 给女儿 vibe 了一个故事类的 app,做完发现,这类应用似乎上线难度极大? - V2EX 手机格式化 bitget 钱包没了,里面开通的银行卡还有机会拿到吗 - V2EX [送码] TransVoice - 我的第一款 App 上架啦!实时转写+翻译+字幕,会议听课好助手! PictureHub 高清摄影作品的画廊 Planet 的第一个使用 macOS 26 SDK 构建的 Insider 版本 20260416-1 - V2EX 成都二手房是不是在涨价,有点坐不住了 - V2EX claude 生态(skill mcp plugin)等 Studio Display XDR VESA 适配器脱落 有在用印度区 applestore 的大哥嘛,请教一下礼品卡去哪里买呢 - V2EX 我好像知道京东家政爆火的原因了 - V2EX 薅了公司的 a 家 api key,用机场 ip 做代理容易被封吗 如何在初期就识别 HR 在刷 KPI,没打算招你? [分享]精心打造一个 AI 编程知识库(算法/设计模式/提示词/Skills),助力程序员转型 港版 iPhone 在国内支持联通 5GA 吗?在广东用 想办港卡 AI 对 it 行业影响太大了 我做了个把照片变成 iOS 小组件贴纸的 App ChatGPT Pro 5x 套餐 量真的很足! I have found a method to directly generate advertising video materials using scripts 在小城市开个店,给人写软件,有前途吗 chrome 最新的 147 版直接卡爆炸了 - V2EX 为什么厂家不在 skill/mcp 这类的工具中塞广告呢?这样不是可以大赚嘛? minimax 真是脸都不要了,工作日下午 14:00 定时开启 529,脸都不要了。训练模型居然占用用户使用时间 外资非核心部门 vs 另一家外资的核心部门,该跳吗? iTad 标签 扩展 加小动作 ? - V2EX 去年 H200 能买,不让买是代替快出来了? - V2EX AI 赛事通 - 2026 年 4 月中国区新增 AI 竞赛和黑客松汇总 - V2EX V2EX › 登录 现在安卓开发都在做啥 - V2EX 浏览器插件 沉浸式翻译 是不支持自定义模型了吗? - V2EX Codex 里的 GPT5.4 也能降智?上午让它改两个问题,改了一个小时了, plus 额度用了一半了还是没改好,和前几天用的体感完全不一样。要它改的问题也不复杂。服了。 目前有使用 claude code 的收到人脸认证的吗 - V2EX 分享一个自己做的 Nginx 管理工具,实时请求动态预览!(无奈市面上实在找不到好用的,自己撸了个) - V2EX claude code 崩了么? 今天在反重力上用 claude 一点都不丝滑,有同样的感受吗? opencode 消息周知插件 今天 claude opus 和前两天比,质的飞跃 - V2EX 999 包月价? - V2EX 一个版本, 50 项更新:我们几乎重做了整个播放页 本地大模型多大显存够用? GOGDNS 一款简易的私人 DNS 服务器 - V2EX API key (GLM) 怎么使用 claude code desktop ? Claude 这样订阅有问题吗 - V2EX 帮我爸找回了一篇赛博兰亭集序 求推荐稳定、高性价比使用 Claude Opus 4.6 的渠道/平台 搞个云端 claude code 防止 封号 - V2EX 用 Claude 要实名了,内地用户怎么办? OpenAI Plus 和 Team 都缩水了吗 海外 Android 手机有什么好用的国内第三方应用市场推荐吗 - V2EX 把电脑伪装成电视,用 DLNA 投屏拿到视频号直播流地址 - V2EX claude 认证莫慌 北京互联网法院有什么攻略么?起诉北京智谱华章科技股份有限公司退款可行么? - V2EX Claude 开始引入身份验证 求 vscode 做笔记软件的插件推荐 - V2EX 讯飞星辰的 Coding Plan 如何? Anthropic 宣布在 Claude 平台推行身份验证机制 科普一下低价 gpt 是怎么来的 有没有长期关注 Claude 的朋友,我建了一个 Channel 自动抓取 Claude Team 的推文 啃了那篇 54 页的 Agent Harness 综述, 给大伙讲个省流版 现在那家的 coding plan 还能买到 是不是最近会有什么更聪明的大模型要发布了呀? 用多了 AI 后,有没有觉得 AI 生成的文章有很强的既视感? 如何 实践 Harness 工程? 今日份 GPT 5.4 笑话 如何建一个自己的号池,让 cursor 真正实现 token 自由 写了三个月 Agent Harness,我终于敢让 Claude Code 全自动写代码了
公司项目分享:硅谷人工智能公司 Nexa AI 发布端侧 AI 部署新思路
RemiliaForever · 2025-12-16 · via V2EX

2025 年,是 AI 硬件的全面爆发之年:AI 手机、AIPC 、AI 陪伴、AI 眼镜、AI 智慧座舱……然而,云端大模型主导的 AI 硬件正在显露隐忧:高昂的 API 调用成本让中小企业望而却步,隐私数据上传云端的安全风险如影随形,网络延迟与垂域适配不足更是制约着端侧的场景创新。

开源端侧小模型崛起正在改写游戏规则:根据小模型能力密度发展趋势( Densing Law ),小模型能力大约每 3.5 个月就翻一倍,边缘 AI 推理场景正在从想象变为现实。甚至英伟达也在论文《 Small Language Models are the Future of Agentic AI 》宣告:小模型才是 Agentic AI 的未来。


1. 部署难、表现差?端侧 AI 发展仍面临痛点

当开发者们摩拳擦掌,想要用先进小模型打造创新应用时,现实又浇了一盆冷水:

  • 部署门槛高:端侧平台的推理框架并不像云端那样容易适配:工具链有 CUDA 、QNN 、ANE 、ROCm 、Openvino, openCL, metal, vulkan 等等五花八门……耗费数月踩坑仍难跑通最新模型;
  • 性能表现差:即使顺利通过部署,由于推理引擎适配不当导致精度下降、输出缓慢、能耗飙升,让端侧应用体验大打折扣
  • 跨平台噩梦:不同硬件( PC ,手机,车机,IoT )、芯片(高通、Intel 、AMD 、苹果)间的适配壁垒,让跨设备应用开发重复 “踩坑”,效率极低。例如可以在高通 PC 上运行的多模态模型无法自动移植到高通车载端。
  • 最新的模型支持差:NPU 上普遍只能跑 1 年以前发布的模型,无法使用最新的模型(如 Mistral3, Qwen3-VL ),需要等待非常久的时间。

2. 端侧 AI 部署的新思路

最近美国硅谷明星端侧 AI Startup Nexa AI 公司在 github 上发布的 Nexa SDK ,为全球开发者带来了破局新思路。这个项目致力于解决长期存在于端侧模型部署中的共性问题,让 AI 模型在手机、PC 、汽车、IoT 等边缘设备上的落地变得前所未有的简单。

github 项目链接: https://github.com/NexaAI/nexa-sdk

Nexa SDK 构建了 4 大核心优势,解决端侧 AI 部署的核心痛点:

  • 跨平台统一推理框架:NexaSDK 由 NexaML 引擎提供支持,该引擎是从芯片 Kernel 层打造的跨硬件平台统一推理引擎(电脑,手机,车,IoT ,机器人,以及 XR 眼镜),并支持三种端侧模型格式:GGUF 格式、MLX 格式以及 Nexa AI 自主研发的 .nexa 格式。这一引擎的能力也被 IBM 认为是比肩 vLLM, MLX, llama.cpp 的四大 inference engine 之一。
  • NPU, GPU, CPU 深度适配:NexaSDK 可在多种算力平台的 NPU 、GPU 、CPU 上本地运行各类人工智能模型 —— 它不仅使用简单、灵活性高,而且性能佳。特别是支持各大算力平台的 NPU 芯片(覆盖高通 Hexagon NPU, 苹果 NPU ,AMD Ryzen AI NPU ,以及 Intel NPU ),充分利用 NPU 性能,可以解决过往端侧模型在 CPU/GPU 上运行带来的输出速度慢、能耗畸高的问题,推理性能可达到 CPU 1.5 倍 ,GPU 4 倍,能效比提升 2–8 倍。 Imgur
  • 任意多模态模型 Day-0 支持:面对快速更新的开源模型市场,Nexa SDK 能够做到在新模型推出的第一时间适配各个硬件后端( NPU, GPU, CPU ),并且支持多种模态 Vision, Text, Audio, 以及 CV 模型;
  • 低代码极致易用:使用一行代码即可调用本地模型,OpenAI API 兼容设计让开发者无缝衔接代码,大大降低了端侧 AI 的应用门槛。

Nexa SDK 与其他端侧 SDK 的比较优势:

Features NexaSDK Ollama llama.cpp LM Studio
NPU 支持 ✅ NPU 优先
Android SDK 支持 ✅ NPU/GPU/CPU 支持 ⚠️ ⚠️
支持 GGUF 、MLX 、NEXA 任意一种格式的模型 ✅ 底层控制 ⚠️
全面支持多模态 ✅ 图像、音频、文字模型 ⚠️ ⚠️ ⚠️
跨平台支持 ✅ 桌面端、移动端、车载端, IoT 端 ⚠️ ⚠️ ⚠️
一行代码调用 ⚠️
兼容 OpenAI API + 函数调用

✅完全支持 ⚠️部分或有限支持 ❌ 不支持

NEXA SDK 一经发布也获得了包括 AMD/高通的诸多行业认可: Imgur Imgur

3. 快速上手:快速解锁端侧 AI 能力

根据使用方式和平台,Nexa SDK 提供不同的工具包:

  • Nexa CLI:可在 MacOS/Windows/Linux 使用命令行终端速测试模型及运行本地服务器;同时支持在 Linux 系统的容器化环境中运行 AI 模型;
  • Nexa SDK Python 开发工具:可在 MacOS/Windows/Linux 平台使用 Python 完整运行 SDK
  • Nexa SDK Android/iOS 开发工具: 支持在移动端设备跨 NPU/GPU/CPU 推理的安卓/iOS 开发工具包 Nexa SDK 实现了全平台支持,全球首次统一支持苹果 NPU 、Intel NPU 、AMD NPU 、高通 NPU 等 4 类 NPU 推理加速芯片,让端侧模型边缘推理拥有了更广泛的实现和应用场景。

3.1 Nexa SDK CLI 快速体验

下载路径:

可以从 github: https://github.com/NexaAI/nexa-sdk 或者 https://sdk.nexa.ai 下载 Nexa CLI 。

Imgur

一行代码运行模型

Nexa SDK 支持 LLM 、多模态、音频( ASR\TTS )、CV 、生图等多种端侧模型。例如:

多模态模型

NexaSDK 在 Qwen3VL 发布当天 Day-0 跨平台支持,领先 llama.cpp/ollama 三周,并得到 Qwen 官方认可

nexa infer NexaAI/Qwen3-VL-4B-Instruct-GGUF

车载多模态模型(适配高通 NPU )

nexa infer NexaAI/AutoNeural

相比于其他框架,NexaSDK 对于新模型的支持速度还是非常迅速,可以访问 Nexa AI 官方模型仓库 https://huggingface.co/NexaAI 查看使用更多精选的模型。 Imgur

目前 Nexa CLI 支持 MacOS 、Windows 、Linux (并支持 Docker 运行),同时提供 Python API, IOS Swift API 、Android Kotlin/JAVA API 开发工具包,

兼容 OpenAI API NEXA CLI 还提供 OpenAI 兼容的 REST API ,一行命令即可访问服务接口,无缝覆盖对话生成、文本嵌入、文档重排序、图像生成等核心场景,满足多样化开发需求。

nexa serve

  • /v1/chat/completions - 用于 LLM 和 VLM 的对话生成
  • /v1/embeddings - 为文本生成向量嵌入
  • /v1/reranking - 根据查询相关性对文档重新排序
  • /v1/images/generations - 根据提示生成图像
  • 更多命令可以查看: https://docs.nexa.ai/nexa-sdk-go/NexaAPI

3.2 Nexa SDK Python 开发工具包

Nexa SDK Python 工具包,适配 MacOS 、Windows 、Linux 等全平台优化后端,无论是本地开发还是企业级应用,都能使用 Python 更高效落地。可以使用 Python API 一键运行 LLM 、VLM 、OCR 、ASR 、TTS 、图像生成、说话人分离、键值缓存、采样配置、对话模板以及错误处理等。

Imgur

更多文档参阅: https://docs.nexa.ai/nexa-sdk-python/overview

3.3 Nexa SDK Android/iOS 开发工具包( 3 行代码快速开始)

下载地址:

Nexa SDK Android 工具包:可直接从 Maven 中央仓库获取,或访问 github: https://github.com/NexaAI/core

dependencies {
    implementation("ai.nexa:core:0.0.12")
}

Nexa SDK iOS 工具包: https://github.com/NexaAI/nexasdk-mobile-iOS-framework

  • Android 设备上支持直接运行的包括 LLM 、VLM 、Embedding 模型、OCR 模型、CV 模型、ASR 模型、rerank 模型以及生图模型,且支持通过 NPU 、GPU 和 CPU 进行推理。通过 Kotlin/Java API 轻松集成,性能提升 2 倍,能效比优化 9 倍,重塑移动智能体验。 Imgur 更多文档参阅: https://docs.nexa.ai/nexa-sdk-android/overview
  • 使用简洁的 Swift API ,开发者可在 iOS/macOS 设备上直接运行 LLM 、VLM 、Embedding 模型、ASR 模型以及 rerank 模型。目前,ASR 模型与 Embedding 模型已支持 苹果神经网络引擎( ANE )加速,其他模型则基于图形处理器( GPU )与中央处理器( CPU )运行,同时可以达到性能提升 2 倍,能效比优化 9 倍的惊艳体验。 Imgur 更多文档参阅: https://docs.nexa.ai/nexa-sdk-ios/quickstart

4. 为开发者带来丝滑体验:创意无需妥协

  • 一行命令跑通:nexa infer 极简操作,告别复杂配置;
  • OpenAI API 无缝兼容 :现有代码零修改,直接迁移端侧运行;
  • 95% NPU 利用率:性能优于 Qualcomm GENIE ,极致发挥硬件潜力;
  • 首发支持前沿模型:Qwen3 、Granite 、Liquid 、Gemma 3n 、Parakeet 等最新模型快速适配;
  • 结构化输出:天然适配 AI Agent 工作流,加速应用创新;
  • 持续更新的前沿端侧模型库:Nexa Model Hub 不断扩充,让最先进端侧小模型触手可及。

Imgur

5. 结束语:从个人到产业 —— 端侧 AI 想象力不再设限

当部署不再是难题,当性能不再妥协,端侧 AI 的革命,正在每一个场景悄然发生:

  • 📱 手机:离线助手,日程提醒、生活助理……
  • 💻 PC:文件管理、个人知识库构建、Agent 协作……
  • 🚗 汽车:车内 AI 助手,实时路况提醒,安全监测……
  • 🤖 IoT & 机器人:工厂巡检、缺陷检测……

端侧 AI 的低成本、高隐私、低延迟特性,正在重构产品形态,催生全新商业模式。

希望今天分享的 Nexa SDK 能让每一位热爱端侧 AI 的人都能参与到端侧 AI 的浪潮中,无需复杂的工具链,消解沉重的技术壁垒,赋能每一位开发者,解锁端侧 AI 落地的无限可能!

github 项目链接: https://github.com/NexaAI/nexa-sdk (如果认为对您工作有帮助,欢迎为开源作者 star )