惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Jina AI
Jina AI
Recent Announcements
Recent Announcements
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
月光博客
月光博客
A
About on SuperTechFans
Vercel News
Vercel News
博客园 - 【当耐特】
爱范儿
爱范儿
Blog — PlanetScale
Blog — PlanetScale
阮一峰的网络日志
阮一峰的网络日志
V
V2EX
D
Docker
博客园 - 叶小钗
The Cloudflare Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
H
Help Net Security
I
InfoQ
博客园 - 三生石上(FineUI控件)
博客园 - Franky
Microsoft Azure Blog
Microsoft Azure Blog
The GitHub Blog
The GitHub Blog
大猫的无限游戏
大猫的无限游戏
MongoDB | Blog
MongoDB | Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报

机器学习

深度学习的 LLM 就像受伤的大脑 大语言模型会被其他技术取代吗? llm 训练最 dirty work 的就是数据处理! 做机器学习强烈推荐看看 MIT 18.S096 矩阵微积分 求助微信聊天记录训练 ai 请问 AI 训练大佬 : 目前大家不写 blog, stackoverflow 等,如何训练新的优质数据,还是拿 AI 数据训练自己? 想要真正理解目前的深度学习(不仅是打杂的炼丹师),需要怎样的数学基础 怎样加快 onnx 模型在 cpu 上的推理速度啊 AI 公司瞄准的顺序是浏览器、输入法、操作系统 有什么能本地跑的机器学习项目吗? 求助 使用 ddddocr 自训练模型场景下,遇到了 onnxruntime.capi.onnxruntime_pybind11_state.InvalidArgument BERT 论文复现: 经验 & 教训 求推荐一些 LLM/深度学习方面打基础的书籍或者课程 2025 年底,如果想做一个图像分类模型,用什么模型来微调比较好 目前使用 yolov8 训练了一个目标检测模型,但是上线使用效果不是很好,怎么优化? 最近看 1-2 万主机发现 3090 还是能打的 想做有声小说声音克隆, 3060Ti 能扛得住吗? [AI Glimpse 科普系列] KV Cache 的原理推导与代码实现(基于 GPT2) 关于 OCR 以及以图找图识别 这类型的英语学习视频,是用哪个模型生成? 怎么实现提取俩个图片的一些特征,然后进行特征比对 检测画面中存在漏水,给点思路 学习 AI, 跑下模型, 应该用什么 N 卡? 有没有大佬了解机器学习的 mlops 框架或者平台 如何把本地文件作为大模型的知识库 使用大语言模型进行文本分类任务需要微调吗? lima 和 colima 居然是有关系的 gpt4o 图像生成的技术讨论(自回归模型又好起来了?) [AI Glimpse 科普系列] 不到 100 行 Python 代码从零实现 LLM 的推测采样算法 什么?唠唠嗑就能生成游戏关卡! Unreal Engine + MCP 来了!
llama.cpp 服务开启 embedding 是否稳定?
fox0001 · 2026-06-24 · via 机器学习

发现“千问”官方提供了qwen3-embedding-4b的量化版,而且是 gguf 格式。使用 Ollama 试用了一下,发现Q4_K_M的效果不错,只比0.6b大了一倍左右。

现在的问题是,部署qwen3-embedding-4b的 gguf 格式版本,生产环境(基于 CPU 推理)应该选用哪个推理服务部署?

  1. llama.cpp
    • 其 Docker 镜像体积小,内存占用也小。
    • 想使用这个在生产环境部署,但是 Gemini 提到其推理功能没有问题,但其 Server 服务不够稳定。
    • 不知道有没有在生产环境使用的成功案例。
  2. Triton Server
    • 其 Docker 镜像除了体积大,配置较复杂,暂时没有确定。我们生产环境也用过。
    • 目前配置也没问题,剩下体积大的问题。
  3. Ollama
    • 即使集成了很多功能,但体积仍然比 Triton Server 少。
    • 我们一般用于试用新模型,没在生产环境使用。
  4. TEI
    • 即 Huggingface 的 Text Embeddings Inference ,但是不支持 gguf 格式。
    • 此方案不可用。