惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
The Blog of Author Tim Ferriss
IT之家
IT之家
Engineering at Meta
Engineering at Meta
WordPress大学
WordPress大学
博客园 - 三生石上(FineUI控件)
博客园 - 聂微东
C
Check Point Blog
T
Tailwind CSS Blog
博客园 - Franky
H
Help Net Security
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Google DeepMind News
Google DeepMind News
博客园 - 叶小钗
J
Java Code Geeks
腾讯CDC
罗磊的独立博客
爱范儿
爱范儿
阮一峰的网络日志
阮一峰的网络日志
Martin Fowler
Martin Fowler
酷 壳 – CoolShell
酷 壳 – CoolShell
I
InfoQ
B
Blog
V
Visual Studio Blog
F
Fortinet All Blogs

博客园 - Parry

PDF 多格式解析如何避免混用输出:TEXT、HTML、XML 与 TAG 数据契约 基金组合风险如何避免“一个分数说风险”:样本覆盖、VaR 与风险贡献 RAG 问答如何证明答案来自文档:知识库版本、引用片段与线程隔离 SEO 排名监控如何避免单次快照误判:SERP 任务、credits 与历史对比 ETF 盘中看板如何处理分钟行情:时间窗口、新鲜度与缺口标记 节气日历服务如何统一日期口径:时区、历法事实与文化参考分层 国际号码接入校验台案例方案 户外项目日照与节气计划台案例方案 门店二维码资产管理台案例方案 用传统历法宜忌接口构建节气日历服务 全球区域与 IP 定位工作台案例方案 基金组合风险分析台案例方案 A 股公告与科创板研究台案例方案 搜索可见性与 SEO 观测台案例方案 研究生招生信息决策台案例方案 微信资讯素材采编中心案例方案 多语言语料标注与实体分析台案例方案 智能文档字段提取工作台功能需求文档 SEO 自动巡检怎么做:用 PageSpeed、DNS、SSL 与 WHOIS 定位网站问题 咕咕监控 3.2.0:网页有重要变化时,第一时间告诉你 Python 接入 OCR:把图片文字整理成可校验的 JSON 字段 「鸭川小记」:让语音先流动起来,再慢慢变成可整理的内容 个人公开市场研究笔记功能需求文档 网页归档与报告生成系统功能需求文档 网站工具与内容转换台功能需求文档 全球大学排名查询网站功能需求文档 汽车车型内容资料库功能需求文档 资讯元数据管理平台功能需求文档 内容质检与纠错工作台功能需求文档 文本 NLP 分析平台功能需求文档
文章抽取信息化 JSON API 接口
Parry · 2026-04-10 · via 博客园 - Parry

文章抽取信息化 JSON API 接口

接口详情官网地址: https://www.gugudata.com/api/details/article-extract

文章抽取信息化 JSON API 任意网页 URL 或 HTML 提取文章 JSON,网页处理、LLM等关键词场景常会用到,适合用于内容生成与智能处理、多语言文本工作流与知识服务与问答能力接入等业务场景,方便开发者直接在应用、脚本或数据流程中接入。

gugudata_api_cover

1. 产品功能

  • 支持从任意网页 URL 提取干净的文章内容;
  • 自动去除广告、导航栏和非内容元素;
  • 提取文章标题、内容、作者和发布日期;
  • 支持自定义解析器和获取选项;
  • 提供独立的 HTML 字符串提取接口(/ai/v1/articles/extractFromHtml);
  • 支持直接从 HTML 字符串提取;
  • 高质量的内容提取,智能解析;
  • 全接口支持 HTTPS(TLS v1.0 / v1.1 / v1.2 / v1.3);
  • 全面兼容 Apple ATS;
  • 全国多节点 CDN 部署;
  • 接口极速响应,多台服务器构建 API 接口负载均衡;

2. API 文档

接口地址: https://api.gugudata.com/ai/v1/articles/extract

返回格式: application/json; charset=utf-8

请求方式: POST

请求协议: HTTPS

请求示例: https://api.gugudata.com/ai/v1/articles/extract?appkey=YOUR_APPKEY&url=YOUR_VALUE

数据预览: https://www.gugudata.com/preview/article-extract

接口测试: https://api.gugudata.com/ai/v1/articles/extract/demo

3. 请求参数

参数名 参数类型 是否必须 默认值 备注
appkey string YOUR_APPKEY 付费后获取的 APPKEY,可通过查询参数或请求体传递
url string YOUR_VALUE 需要提取文章内容的网页 URL 地址

4. 返回参数

参数名 参数类型 备注
DataStatus.StatusCode int 接口返回状态码
DataStatus.StatusDescription string 接口返回状态说明
DataStatus.ResponseDateTime string 接口数据返回时间
DataStatus.DataTotalCount int 此条件下的总数据量,一般用于分页计算
Data.url string 文章的源 URL
Data.title string 提取的文章标题
Data.description string 文章描述/摘要
Data.links array 文章中包含的链接数组
Data.image string 文章主图片 URL
Data.content string 提取的文章内容(HTML 格式,已去除广告和导航栏)
Data.author string 文章作者(如果可用,可能为空字符串)
Data.favicon string 网站图标 URL
Data.source string 来源网站域名(如 sohu.com)
Data.published string 文章发布日期/时间(格式:YYYY-MM-DD HH:MM)
Data.ttr int 预计阅读时间(Time to Read,单位:分钟)
Data.type string 文章类型(如 news、article 等)

5. 错误码说明

状态码 错误说明 备注
100 正常返回 文章成功提取
101 参数错误 无效或缺少必需参数(url 参数是必需的)
102 请求频率受限 每秒请求不能超过 100 次
103 账号欠费 -
104 APPKEY 错误 请检查传递的 APPKEY 是否为开发者中心获取到的值
110 接口响应错误 文章提取过程中发生内部服务器错误。URL 可能无法访问或内容格式可能不受支持

6. 适用场景

  • 适合用于内容生成与智能处理,快速补齐产品侧需要的 文章抽取信息化 JSON 数据能力。
  • 适合用于多语言文本工作流,减少手工整理、清洗与重复开发成本。
  • 适合用于知识服务与问答能力接入,将接口结果直接接入后台系统、数据任务或内容处理流程。

7. 相关接口