惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
M
MIT News - Artificial intelligence
D
Docker
S
SegmentFault 最新的问题
B
Blog
Apple Machine Learning Research
Apple Machine Learning Research
博客园_首页
博客园 - 【当耐特】
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
The GitHub Blog
The GitHub Blog
Y
Y Combinator Blog
腾讯CDC
阮一峰的网络日志
阮一峰的网络日志
U
Unit 42
C
Check Point Blog
GbyAI
GbyAI
美团技术团队
Recent Announcements
Recent Announcements
F
Fortinet All Blogs
量子位
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
V
Visual Studio Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
G
Google Developers Blog

翻译

为啥 are not bad with 要这么理解呢 我又又又上线了一个新的翻译网站 有没有免费的大文件的翻译 我尝试 2 小时上线一个翻译网站 基于 IOS 的快捷指令和火山引擎的图片翻译 API,实现的移动端屏幕翻译功能 如何找带有中文字幕的英文 Native Speaker 的视频 网易有道翻译,未通知开发者,就突然改变了 api 接口的响应格式,真 sb 恶心啊 让人吐血的经典翻译: LLM ==> 法学博士, YouTube ==> 优酷 请问大家会如何翻译“大陆居民往来台湾通行证”和“港澳居民来往内地通行证”这种名词? 请教一下大家,现在还有那种业余兼职翻译相关的平台么 求问大家, 能网页翻译的浏览器插件哪个比较好用 请问中文翻译泰文的线上翻译(免费)哪个准确性最高? 在读英文文档的过程中,又臭又长的、好几节的定语从句大家都是怎么阅读理解的? 蒸蒸日上的火山翻译 麻烦各位给个反馈,deepl 翻译的免费版还能正常用么? 大量的 HTML 文件需要翻译,用什么方法比较好? V 站底部 创意工作者们的社区 用英文怎么表示最合适? 友链 英文怎么写? 灵光乍现,帮朋友把一幅画的中文介绍翻译成英文 instrumentation/instrumented/Instrumenting 怎么翻译 开个顶级吐槽坑,讨论那些程序方面翻译。 中文名有了,帮朋友公司征个英文名 “上火”应该怎么翻译比较好呢? 中译英,这句话的翻译有点奇怪 动漫完美世界英文字幕组招募 百度搜了下居然没有,“兜底”这个词怎么用英文表达?我想弄个兜底 Servlet,对所有没有 mapping 的 request-uri 自己处理,这个兜底你会翻译成啥? 你们有没有发现, Google 翻译很多时候意思都是反的😱😱😱 这句话怎么翻译? 在探讨 Dragon 和 Loong 的同时,也不要忘了凤凰 "龙"是翻译为 dragon 还是 loong ?
我用 Deepseek OCR 做了一款图片翻译神器
devlrboyz · 2025-10-24 · via 翻译

最近 Deepseek OCR 很火,刚刚开源了他们最新的 OCR 识别技术,即刻集成来做了一个图片识别工具体验了一下,识别效果杠杠的,以下是我的技术实现方案:
简单来说,整个过程只需要 3 步:
1️⃣ 识别文字
调用 Deepseek OCR 将图片里的文字识别出来
2️⃣ AI 翻译
将识别结果交给 AI 大模型,比如 Deeepseek 本身以及豆包大模型或者任意的 AI 模型均可进行翻译
3️⃣ 将文字进行润色后重新粘贴会选位置
这是很关键的一步,如果处理不好就无法很好的还原文字的位置。具体如下:
首先要将图片的逻辑分区(例如一张海报分标题,正文,按钮文案等)
然后将每个分区整体作为一段交给 AI 去翻译,并指定提示词让 AI 翻译的更地道
4️⃣ 润色阶段
因为中文或者其他语言长度不同于英文,所以需要计算每段文字宽度比例,尽可能的避免超出原框。
5️⃣ 文本回填与图像重绘
这个主要是把翻译后的文字重新绘制到图片原位置。怎么实现呢?一般有两种方案:
方式一:传统图像绘制(常见方案)
使用图像处理库重新渲染翻译文字。
• Node.js:canvas / sharp / jimp
• Python:Pillow / OpenCV
✅ 方式二:AI 图像修复 + 文本重构(高级方案)
用于复杂背景、渐变、阴影、艺术字体的场景。
流程:
1. 用 OCR 坐标擦除原文字区域(生成 mask )
2. 用 Inpainting 模型(如 SDXL Inpaint 、BrushNet 、GLIGEN )修复背景
3. 再用绘制模块叠加译文文本
优点:背景无痕、视觉一致。
缺点:算力需求高、处理时间更长。
最后,奉上我的应用整体架构:
前端 : Nextjs + React + tailwindcss + shadcnui
后端 : FastAPI + Python + Honojs + cloudflare worker + postgresql + redis + Pillow + Sharp + 各大厂商大模型
第三方服务: resend 邮件服务 + 火山引擎对象存储 + 腾讯云 EdgeOne
以上就是我的应用的所有技术实现方案,基本上这些服务都有免费额度,除了服务器和域名需要花点钱,其它基本上前期都不会产生费用,可以说算是一个合格的"开发者穷鬼套餐"了[笑哭 R]
最后欢迎大家来体验这个工具,一起探索 AI 技术带给我们工作效率的全新体验[派对 R]