惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

aimingoo的专栏
aimingoo的专栏
WordPress大学
WordPress大学
阮一峰的网络日志
阮一峰的网络日志
博客园 - 司徒正美
月光博客
月光博客
宝玉的分享
宝玉的分享
Recent Announcements
Recent Announcements
小众软件
小众软件
H
Hackread – Cybersecurity News, Data Breaches, AI and More
美团技术团队
博客园 - 三生石上(FineUI控件)
A
About on SuperTechFans
J
Java Code Geeks
云风的 BLOG
云风的 BLOG
罗磊的独立博客
大猫的无限游戏
大猫的无限游戏
IT之家
IT之家
Vercel News
Vercel News
量子位
Martin Fowler
Martin Fowler
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
V
Visual Studio Blog
腾讯CDC
有赞技术团队
有赞技术团队

分享创造

分享 KCase 脑图测试用例生成平台(AI 辅助生成测试用例) 标签页囤积症自救:写了个插件 TabRack,主打快速检索、自动分类和 AI 摘要 [file-preview]一个比较全面的在线文件预览组件库-支持 react 和 vue 撸了个 iOS 小应用[极简水印相机],直接免费 做了一个 V2EX Skill 写了个 iOS 打码 App「遮鸭 Maskduck」,纯离线免费 35 岁前端,裁员失业后,我花 1 个月做了个 AI 生图网站 亲身经历猫咪急症,我做了一款猫狗疼痛检测工具,希望能救你家毛孩一命 如何用 AI 做比较酷炫的落地页? 求真!最近 AI 生图的能力强到可怕 开源一个查看 k8s 的菜单栏工具-kubebar Packpour:我做了个专门给 App Store Connect 填多语言元数据的小工具 面对 140 年一遇的超级厄尔尼诺,我做了个全球监测小站 做了一个自动翻译的 Hacker News 客户端 做了一个 AI 头像生成器,可以免费生成 2 次 [送码 50 个] 自己手搓了个高颜值的倒数日 App——拾光机,求 V 友们指点 一个将苹果健康 APP 数据导出的工具,然后把你的数据喂给 AI 分析 我做了一个叫「订阅斩」的 iOS App,专门对付那些悄悄扣钱的订阅 做了个草率的日麻互动漫画,听听反馈 喜欢自己洗车的朋友们,我用 ai 做了一款洗车小程序 -- 洗车志 感谢 V2EX 上各位 NAS🍆 和 Datahoarder 玩家的关注和真实反馈!作为个人开发者,能得到这么多硬核玩家们的讨论,我非常荣幸。 用 AI 开发熊孩子自律的小程序 用 OpenClaw 搭建个人运动助手 今天摸鱼给 NanaAI 也接入了 GPT-Image-2 [Video Companion]一个 chrome 插件,解决大多对视频操作的需求~欢迎使用提 bug AI 时代,做产品简单了,把产品推广出去却变的更难了~ bestskills.dev - Skills 精选和评测站点 免 ROOT 强力卸载安卓广告软件 一个 All In One 的运维工具,支持 SSH、数据库、Redis 管理 [开源] Codeg V0.10:专注于代码生成的多智能体 IDE(cc、codex、gemini、opencode……),新版本重构了工作区,飞一般的体验,支持桌面端、服务器部署
开源一个可插拔记忆增强型 LLM 代理服务
isSamle · 2026-06-02 · via 分享创造
  • 项目地址: https://github.com/Czj1997-02/MemoryProxy
  • 项目说明: 基于 FastAPI 的网络请求转发代理,为任意 OpenAI 兼容协议的 LLM 服务注入长期记忆能力。支持多用户记忆隔离、混合检索(向量语义 + 标签匹配 + 图谱扩散)、多级抽象标签体系、元关联图谱、时序对话存储,并附带开箱即用的简单 Web 对话界面。
  • 使用方法: http://memory-server:9917/http://model-api/v1
  • 理想状态:项目的最终目标,是构建一个可热加载参数的记忆模型,启用 GPU 加速和相关的记忆算法处理记忆数据,待完善…
  • 相关 AI 提示词
我会把我一开始的需求内容再次发给你,你要逐个文件确认,需求被正确实现,功能代码正常可用:

我计划写一个可插拔的记忆模块,通过转发模型调用请求时,存取记忆来实现模型记忆外挂。这里会涉及到内容的处理,记忆的结构化梳理,向量数据库的读写,嵌入模型的调用等,所以最好使用 python 实现。

我的设想是,这个记忆模块是一个类似模型的存在,通过传入的内容这个记忆模型每次都在发生参数变化和热重载,通过 http://memory-server/http://openai-api/v1/chat/completions 的形式,在转发过程中,发生记忆的读取,并同时在不过多影响响应的情况下完成记忆存储。

应允许用户传递请求头 MEMORY_USER ,由用户自行设置 512 位以内的字符作为用户识别码,用来对记忆进行分隔,当设置了 MEMORY_USER 时应只允许读取 MEMORY_USER 关联的记忆和 SYSTEM 关联的记忆,未设置 MEMORY_USER 时默认 MEMORY_USER 为 SYSTEM 。

记忆应考虑联想记忆法,宫殿记忆法等多种记忆方法,以及数学统计学的聚类等方法,用于构建易于检索的记忆模型。

因为单纯的通过向量模型嵌入,可能因为关键词匹配度不够高导致检索不到理想的记忆,所以应该对记忆内容做元关联和抽象化标签控制。

如果涉及到需要 llm 模型介入的功能,应在环境遍历中另外配置使用,减少转发模型接口的调用,避免主要请求开销过大照成卡顿。

关于 Milvus 向量数据库,有几点细节需要注意
1. 应使用官方的 python 库实现相关操作
2. 在环境变量中设置了 MILVUS_DB_NAME=memory ,如果不存在需要自动创建
3. 需要按 MEMORY_USER 对数据进行隔离
4. 如果需要的时候,允许自动创建 collections ,但是需要同时自动将 collections 设置为加载。

复盘下,记忆的存储是否考虑了数据库字段长度,是否考虑了嵌入模型的最大 token 和维度。模型接口的返回内容也应该记录到记忆当中。

需要用一张表,记录时间,MEMORY_USER ,记忆归属角色 role:user/system/ai/other ,和具体的记忆内容,并和记忆向量表做关联,便于用户问题涉及时序,如几时问过什么问题,上一次问的什么问题之类的内容时,可以根据时序获取到记忆内容,且需要这张表能有分页 api 用于查询,便于将对话记忆等内容,通过接口获取,用于前端渲染。

并帮我开发一个简单的前端展示页面,用户能够在页面缓存中记住 MEMORY_USER ,模型 api ,模型名称等配置信息,然后进行对话,要支持 markdown 渲染。使用上面的接口获取记忆数据进行渲染,当滚动记忆对话往上时,逐步加载更多的对话记忆内容。

进行一遍复盘,确保所有功能需求被实现,确保代码功能正常。