帮助中心文档转 Markdown:用 Playwright 批量抓取飞书项目手册

作者: Clio 分类: AI工具,飞书项目 发布时间: 2026-01-22 11:18

包含两部分:

  1. 批量抓取飞书项目帮助中心文档工具:沿“下一篇”链路自动抓取,并输出 Markdown。
  2. 飞书项目帮助中心文档(已抓取):位于 output/,可直接用于知识库。

核心技术

  • Playwright:浏览器自动化与页面渲染
  • Turndown:HTML 转 Markdown
  • Cheerio:HTML 表格解析并转为 Markdown 表格
  • Node.js:脚本编排与文件写入

功能实现顺序与思路

  1. 解析参数(起始 URL、最大页数、起始编号、输出目录)。
  2. 启动浏览器并打开起始页面,等待内容渲染完成。
  3. 选择包含正文的 frame,并用启发式方式定位主内容容器。
  4. 移除导航、页脚、按钮等噪音节点,保留正文结构与链接。
  5. 将正文 HTML 转换为 Markdown,写入 output/###-标题.md。
  6. 识别“下一篇”按钮或点击切页,获取下一页 URL。
  7. 循环抓取并更新索引清单 output/index.json。
  8. 可选执行清洗脚本,去除无意义占位图片、零宽字符、多余空行,并把残留 HTML 表格转换为 Markdown 表格。

已实现,并上传到Github

GitHub - HeyClioo/feishu-project-docs-scraper: A Playwright scraper that walks the Feishu Project help center and exports every article to clean Markdown — includes the scraped docs, ready for a knowledge base. · GitHub

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注