

























hxnormalize 和 hxselect 来自 `html-xml-utils` 包。`hxnormalize -x` 补全缺失的结束标签、输出 XHTML;`hxselect 'table.data'` 提取 CSS 选择器匹配的元素,`-s '\n'` 让每个元素之间插空行,防止 w3m 把相邻行粘在一起。
w3m -dump 会把 HTML 渲染成纯文本表格,列宽自动对齐。`-cols 2000` 防止长行被截断导致列错位。这一步拿到的是固定宽度的文本,类似于这样:
排名 名称 营收 1 Wal-Mart $307.7B 2 Kroger $78.3B 3 Target $65.8B 4 Walgreen $61.2B 5 The Home Depot $60.2B
awk FIELDWIDTHS 是 GNU Awk 的功能(不是 POSIX 标准)。`FIELDWIDTHS="5 29"` 告诉 awk 按字符宽度切分字段:前 5 个字符是第一个字段(排名),接着 29 个字符是第二个字段(名称),剩下的全归第三个字段(营收)。
后面的两个 gsub 去掉字段 2 首尾的空白,最后打印出公司名。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。