惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Cisco Talos Blog
Cisco Talos Blog
量子位
小众软件
小众软件
Microsoft Azure Blog
Microsoft Azure Blog
V
Visual Studio Blog
I
InfoQ
Jina AI
Jina AI
The Cloudflare Blog
Recorded Future
Recorded Future
Recent Announcements
Recent Announcements
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
G
Google Developers Blog
Stack Overflow Blog
Stack Overflow Blog
阮一峰的网络日志
阮一峰的网络日志
Microsoft Security Blog
Microsoft Security Blog
美团技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Martin Fowler
Martin Fowler
T
Tailwind CSS Blog
博客园 - Franky
酷 壳 – CoolShell
酷 壳 – CoolShell
F
Fortinet All Blogs
WordPress大学
WordPress大学
P
Proofpoint News Feed
D
DataBreaches.Net
爱范儿
爱范儿
雷峰网
雷峰网
D
Docker
B
Blog
Engineering at Meta
Engineering at Meta
腾讯CDC
N
Netflix TechBlog - Medium
C
Check Point Blog
博客园 - 【当耐特】
Apple Machine Learning Research
Apple Machine Learning Research
T
Tenable Blog
GbyAI
GbyAI
Security Archives - TechRepublic
Security Archives - TechRepublic
博客园 - 三生石上(FineUI控件)
T
The Blog of Author Tim Ferriss
博客园 - 聂微东
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
SecWiki News
SecWiki News
S
Security @ Cisco Blogs
S
Security Affairs
V
V2EX
Application and Cybersecurity Blog
Application and Cybersecurity Blog
云风的 BLOG
云风的 BLOG
C
CERT Recently Published Vulnerability Notes
Y
Y Combinator Blog

博客园 - jblzg

用powershell脚本实现Andoird为不同市场编译、签名自动化,效率极大提高 JSON与Protocol Buffers Visual Studio 2008提高工作效率的小技巧 转:批处理获得任意天前的日期 SQL Server 2008 事务日志物理文件尺寸无法减小的解决办法(含日志收缩(shrink)技巧) 用虚拟机实际体验Google Chromium OS (Chrome OS) Pre-Built 由一个案例引出SQL注入防范(WebKnight),补救(数据修复)的思考 参加Google Developer Day 2009归来 网站首页、频道首页静态化的问题 宽高比例不固定的用户头像纵向居中的方法(不使用表格、代码精简、图片不变形) Canonical URL Tag - 继SiteMap之后最重要的搜索引擎优化实践 - jblzg 金额字符串转换成Decimal格式的怪问题引发的思考 对常规启用 IIS6.0 Gzip 方法的补充,用于解决wget、curl等无法得到压缩结果的问题 FCKeditor.NET的配置、扩展与安全性经验交流 搜狐博客列表页面分析 ASP.NET Web 开发中的静态资源(JS、CSS、图片)版本控制 避免修改Web.config的appSettings配置时导致的所有页面重编译 参加Google Developer Day 2008归来 一次有趣的Debug——使用Lumigent Log Explorer对SQL Server事务日志进行分析,对SQL Server事务、操作进行撤销(恢复)
2009年互联网5大趋势之一:结构化的数据
jblzg · 2009-09-14 · via 博客园 - jblzg

ReadWriteWeb最近推出了系列文章:“2009年互联网5大趋势”,我会将5篇文章逐篇翻译,并加入自己的理解,在尊重原作的基础上,改写成更通俗易懂的文章与各位分享。水平有限,如有谬误,还请指正,非常感谢。

为了便于理解,可以先看一下位于文尾的“译者注”一节。

1、结构化的数据 Structured Data

  第一个主要的趋势是结构化的数据,这个概念在以往有关语义网(Semantic Web)的一些演讲中,曾被引用过,但显而易见,到现在为止,结构化的数据比语义网的发展趋势更加明显。本文会分析结构化的数据在今年的发展,并且有三个产品供参考:OpenCalais, Google, Wolfram Alpha。

不是文档集,而是数据网

  Tim Berners-Lee(译者注:万维网(WWW)的发明者,为互联网的迅速、大规模发展奠定了非常非常重要的技术基础)在二月份曾说我们现在身处一个数据网,而不是一个文档集,Tim Berners-Lee领导的组织W3C,已经大力推动了两个关键行动来建立这个数据网:语义网(Semantic Web)和最近提到的数据链(Linked Data)

  在过去的几年里,我们已经看到了有很多其他方式来建立结构化的数据,目前最好的例子是Twitter,因为 Twitter 90%的访问,都是由第三方程序对其API的使用贡献的(译者注:我一开始很难理解Twitter为什么会是结构化的数据的最佳实例,因为Twitter里面传播的信息统统是非结构化的。但经过仔细思考,发现Twitter其实成功创造了一种使用短信息来更新状态的通讯方式,对于内容更新、状态更新类的数据来说,这的确是结构化的,更重要的是,使用范围之广,已形成事实的标准)。

  数据网的基本概念仍然与由Alex Iskold在2007年3月提到的相同:“未结构化的信息将会让路于结构化的数据,为更智能的计算铺路”。

译者注:来自不同网站的非结构化信息,通过各个公司/组织提供的API,成为了结构化的数据

实例1:OpenCalais

第一个实例产品OpenCalais,很可能是目前最好的有关数据链的产品,这是汤姆森路透(Thomson Reuters)于2008年2月发布的一个API。简单地讲,OpenCalais可以将非结构的网页内容转化为具有语义标记的数据,它可以将数据按照人物、地点、公司等分组组织。通过这种方式,第三方的程序或网站可以利用这些数据生成许多有趣的新应用——这正是数据链的基本定义。

译者注:非结构的文档(文本/HTML),经过OpenCalais的解析,成为了人物、公司、地点、事件等结构化的数据

实例2:Google Rich Snippets

今年5月,Google将结构化的数据添加到了它的核心搜索中,作为一个名为“Rich snippets”的特性出现。这个特性的本质是通过 microformats  RDFa 等开放的结构化数据标准,从网页中提取并展现有价值的信息(译者注:百度最近提的框计算概念,其实类似于数据链,即用户搜索到的不仅仅是网页,还有有价值的数据,比如搜索股票代码,出现的是该股票的实时行情,而不是包含该股票代码的网页链接)。在5月份发布这个特性的时候,Google邀请了内容发布者来标记他们的HTML,尽管要想这种标记广泛使用需要一定的时间,但事实上如果有Google这样的大公司的推动,正显示了结构化的数据于互联网越来越大的重要性。

译者注:一个英文例子,搜索结果直接包含被搜索商品的评论、价格范围

译者注:一个中文例子:结果直接包含被搜索到网站的Alexa排名数据


其他大公司同样引领了这个方向,比如雅虎。

实例3:Wolfram Alpha

 Wolfram Alpha 5月份的隆重推出到现在,作者一直在密切关注这个非常创新的产品。这个一个自描述的“可计算知识引擎 computational knowledge engine”,在一些预测中,它甚至被称为Google克星。虽然这有些夸张,但它的确有不少可能的应用。

  Wolfram Alpha有个类似搜索引擎的界面,可以由用户输入自然语言。但它的主要部分是估算用户的行为,来显示合适的数据,这个产品是以使用与计算数据为前提的。如果Web2.0是产生数据(或者用户产生内容),那么下一代的互联网就是如何使用这些数据了。

总结

  通过以上三个例子我们可以看到结构化的数据正快速地成为当今互联网的一个特性。像汤姆森路透(Thomson Reuters)与Google这样的公司正逐步实现数据的结构化,而更多像Wolfram Alpha这样的产品正在利用结构化的数据实现我们今天根本无法想象的功能。

译者注

为了方便理解,根据我的个人看法,这里解释一下文档、数据、结构化等词,如有谬误,欢迎指正:

  文档:亦内容,可供阅读,传播。如:某产品的某个评论;某应聘人员的简历。

  数据:与内容相同的是可以阅读,传播;胜于内容的是有明确分类,可供分析。如某个产品的评论分数;某应聘人员简历中的年龄,专业、工作年限。

  结构化:数据结构化以后,会更易于分析,查找,抽象。如:某产品有几条评论,分数各是多少(可算出平均分,从而推断口碑最好的产品是哪个);应聘的所有人员的年龄分布、专业分布、工作年限分布。

另,我理解知识生产的过程如下:

信息(消息,新闻) >提取> 数据 >转化。分析> 结构化数据 >抽象> 知识

所以,有了结构化的数据以后,离知识就只差一步了,所以不难想象,未来的互联网是可以自动生产知识的。

2、实时 The Real-Time Web

翻译进行中……

原英文地址:http://www.readwriteweb.com/archives/top_5_web_trends_of_2009_the_real-time_web.php

3、个性化 Personalization

翻译进行中……

原英文地址:http://www.readwriteweb.com/archives/top_5_web_trends_of_2009_personalization.php

4、移动与不断增强的真实性 Mobile Web & Augmented Reality

翻译进行中……

原英文地址:http://www.readwriteweb.com/archives/top_5_web_trends_of_2009_mobile_web_augmented_reality.php

5、所有物体的互联互通 Internet of Things

翻译进行中……

原英文地址:http://www.readwriteweb.com/archives/top_5_web_trends_of_2009_internet_of_things.php