T
trafilatura
adbar/trafilatura
Python 和命令行工具,用于收集网络上的文本和元数据:爬取、抓取、提取,输出为 CSV、JSON、HTML、MD、TXT、XML 格式。
★6.4kstars
Python
Apache-2.0
更新: 今天
📋 项目速览
点击展开
这是什么?用Python构建、打造开源数据与基础设施项目,专注article-extractor和corpus-builder方向
作者是谁?由 adbar 团队维护,GitHub 6.4K⭐,在 数据与基础设施 分类 3133 个项目中排名第 292
为什么诞生?article-extractor在数据与基础设施中的需求持续增长,adbar发现现有方案不够直观,于是创造了trafilatura来降低corpus-builder使用门槛。
能干什么?核心场景:corpus-tools、crawler、html-to-markdown
怎么用 AI 安装?推荐使用 AI 编码助手根据 GitHub README 自动完成 pip 安装和虚拟环境配置。
🔗 github.com/adbar/trafilatura | 官网 https://trafilatura.readthedocs.io
🔗 github.com/adbar/trafilatura | 官网 https://trafilatura.readthedocs.io
标签
article-extractorcorpus-buildercorpus-toolscrawlerhtml-to-markdownhtml2textllmnews-aggregatornews-crawlernlpragreadabilityrss-feedscrapingteitext-cleaningtext-extractiontext-miningtext-preprocessingweb-scraping