惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
Microsoft Azure Blog
Microsoft Azure Blog
L
LangChain Blog
Y
Y Combinator Blog
Microsoft Security Blog
Microsoft Security Blog
宝玉的分享
宝玉的分享
B
Blog RSS Feed
MongoDB | Blog
MongoDB | Blog
Jina AI
Jina AI
D
Docker
B
Blog
Engineering at Meta
Engineering at Meta
Last Week in AI
Last Week in AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
I
InfoQ
G
Google Developers Blog
博客园 - Franky
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
The GitHub Blog
The GitHub Blog
T
The Blog of Author Tim Ferriss
大猫的无限游戏
大猫的无限游戏
阮一峰的网络日志
阮一峰的网络日志
U
Unit 42

DEV Community

Authentication Security Deep Dive: From Brute Force to Salted Hashing (With Java Examples) Why AI Systems Don’t Fail — They Drift Spilling beans for how i learn for exam😁"Reinforcement Learning Cheat Sheet" I Replaced Chrome with Safari for AI Browser Automation. Here's What Broke (and What Finally Worked) How Python Borrows Other People's Work The $40 Architecture: Processing 1 Billion API Requests with 99.99% Uptime Vibe Coding: A Workflow Guide (From Zero to SaaS) Most webhook security guides protect the wrong side. The scary part is delivery. Headless CMS for TanStack Start: Build a Blog with Cosmic EU Age Verification App "Hacked in 2 Minutes" — What Actually Happened Comfy Cloud’s delete function does not actually remove files Running AI Models on GPU Cloud Servers: A Beginner Guide Event-driven media intelligence with AWS Step Functions and Bedrock I scored 500 AI prompts across 8 quality dimensions — here's what broke How to Call Google Gemini API from Next.js (Free Tier, No Backend Needed) The Portal Protocol: Reclaiming Human Connection in the Age of AI How to Fix Your Team's Scattered Knowledge Problem With a Self-Hosted Forum Intro to tc Cloud Functors: A Graph-First Mental Model for the Modern Cloud Designing Multi-Tenant Backends With Both Ownership and Team Access I Built a Neumorphic CSS Library with 77+ Components — Here's What I Learned PostgreSQL Performance Optimization: Why Connection Pooling Is Critical at Scale Cómo construí un SaaS multi-rubro para gestionar expensas en Argentina con FastAPI + Vue 3 🚀 I Built an Ethical Hacking Scanner Tool – Open Source Project I Replaced /usage and /context in Claude Code With a Single Statusline A Pythonic Way to Handle Emails (IMAP/SMTP) with Auto-Discovery and AI-Ready Design I Collected 8.9 Million Polymarket Price Points — Here's What I Found About How Markets Really Move EcoTrack AI — Carbon Footprint Tracker & Dashboard Everyone's Using AI. No One Agrees How. 5 self-hosted ebook managers worth trying in 2026 Building Your First AI Agent with LangChain: From Chatbot to Autonomous Assistant
已完全了解 KMM v0.0.2 的真实能力。直接开写。
Manoir Yantai · 2026-06-20 · via DEV Community

Manoir Yantai

40+ 采集工具的管理清单:从零搭建 AI Agent 知识管线

做 AI Agent 的都知道,上下文窗口再大,没有知识输入管道也是白搭。你写个 Agent 能聊天能调工具,但每次新会话都从零开始——昨天的调研、上周的 PDF、上个月的竞品分析,全得重来。

帮 Agent 记住东西的方案不少,但大多数搞反了方向:直接堆 RAG 向量库,结果发现往里喂的数据质量一塌糊涂。根本问题不是检索算法,是知识压根没进来

Knowledge-and-Memory-Management v0.0.2(KMM)解决的是前半截——先把管道路由建好,再谈搜索。

不是代码库,是工具清单

很多人看到 GitHub 仓库就以为是现成 SDK。KMM 的定位不同:它是一份40+ 采集工具的编排清单,按介质分 4 类:

  • 网页:6 种引擎,从 trafilatura 快速提取到 Scrapling 反检测采集(Cloudflare Turnstile 绕过),到 Chrome DevTools 完整自动化
  • 视频:8 种工具/引擎。抖音元数据+字幕+ASR 一条线、yt-dlp 覆盖 1000+ 站点、Whisper 99 种语言转录、EasyOCR/PaddleOCR 画面文字提取
  • 文章/内容:10+ 来源,微信公众号、微博、新闻聚合、RSS/博客
  • 文档/OCR:PDF/PPT/Word 文字型+扫描型全支持,PaddleOCR 70K⭐ 高精度

每类工具都有统一的 TOOL_INVENTORY 结构,标注能力等级、部署状态和适用场景。不是散装的脚本集合,是按"采集→分析→笔记→图谱→云盘"五步编排的管线框架。

本地优先,AnySearch 自动回落

这是最实用的设计。AugmentedSearch 的搜索逻辑:

from knowledge_augmentation import AugmentedSearch

searcher = AugmentedSearch()
# 先搜本地笔记,命中不足时自动回落 AnySearch
results = searcher.search("Agent 记忆体设计模式")
# 本地命中 ≥ threshold → source: local
# 本地不足 → source: hybrid/web,自动标注来源

核心判断:本地搜索得分 ≥ fallback_threshold 时直接返回,不走网络。低于阈值时自动触发 AnySearch 垂直搜索,结果带 source: web 标识,不会把全网搜索伪装成本地知识。这个设计防止了最讨厌的问题——你问 Agent "我之前记过什么",它拿 web 结果糊弄你。

五步管线:采集 → 笔记 → 图谱 → 同步

NoteGenerator 定义的标准链路很清晰:

  1. 采集原始材料 — 四种 Collector 任意入口
  2. LLM 结构化提炼 — 核心论点、关键数据、时间线、关联阅读
  3. 写入本地笔记 — YAML frontmatter + Markdown,路径 $AGENT_HOME/knowledge/notes/
  4. gbrain 知识图谱入库 — 创建节点、建链接、打标签、记时间线
  5. 云盘同步 — rclone 统一推送到 OneDrive 等 12+ 驱动

精炼层还有个 refine_pdf,直接调用 book_to_skill 管线把 PDF 转成 Hermes Skill + KMM 笔记:

from knowledge_collector.refinement import refine_pdf
result = refine_pdf("machine-learning.pdf", slug="ml-basics")
# → Skill 写入 ~/.hermes/skills/book-ml-basics/
# → 笔记写入 ~/knowledge/structured/ml-basics/

什么时候该用

如果你的 Agent 已经开始出现"我告诉过你的怎么又忘"、或者你每天花大量时间把新信息喂给 AI、又或者发现 RAG 库搜出来的全是噪声——问题大概率不在检索,在采集管道没建起来。

KMM 不提供魔法 SQLite 或者新向量数据库,它给的是工具编排框架。你可能用不到全部 40+ 工具,但它的分层结构(按介质分采集→按 LLM 精炼→按权重回落搜索)是一个值得复用的设计模式。