数据管道/ETL74 / 1052 个项目
数据管道/ETL 排行榜,收录 GitHub 上最热门的 AI 数据处理和 ETL 管道项目,支持数据清洗、标注和特征工程。
Apache Airflow - 一个用于以编程方式编写、调度和监控工作流的平台
一个高性能的可观测性数据管道。
用于ELT管道和AI智能体的开源数据移动——从API、数据库和文件到数据仓库、数据湖和AI应用。支持自托管和云部署。
用于数据资产开发、生产和观测的编排平台。
始终了解数据的预期。
🧙 构建、运行和管理用于集成和转换数据的数据管道。
基于最新LLM的运算符和管道,轻松进行数据准备。
用于AI/ML的开源特征存储
LLM驱动的非结构化数据提取——专为API部署和ETL流水线工作流构建
用于云配置和安全数据的数据管道。构建云资产清单、CSPM、FinOps和漏洞管理解决方案。从AWS、Azure、GCP以及70多个云和SaaS源提取数据。
一个 GPU 加速的库,包含高度优化的构建块和一个数据处理执行引擎,用于加速深度学习训练和推理应用。
面向 AI 和多模态工作负载的高性能数据引擎。可处理任意规模的图像、音频、视频和结构化数据
数据访问与运营智能的结合点
轻松构建数据管道 🛠️
pandas on AWS - 与Athena、Glue、Redshift、Timestream、Neptune、OpenSearch、QuickSight、Chime、CloudWatchLogs、DynamoDB、EMR、SecretManager、PostgreSQL、MySQL、SQLServer和S3(Parquet、CSV、JSON和EXCEL)轻松集成。
一个用于基于代理的LLM驱动数据处理和ETL的系统
构建数据管道的最快 ⚡️ 方式。迭代开发,随处部署。☁️
在数据库内或跨数据库比较表
一个用于机器学习模型和数据管道的开源数据日志库。📚 提供对数据质量和模型性能随时间变化的可见性。🛡️ 支持隐私保护数据收集,确保安全性和鲁棒性。📈
非结构化数据的上下文层:在S3、GCS、Azure上的类型化、版本化数据集
开源推理服务器和生产集群,满足智能体所需的所有模型。
Apache Hamilton 帮助数据科学家和工程师定义可测试、模块化、自文档化的数据流,这些数据流编码了谱系/追踪和元数据。可在 Python 运行的任何地方运行和扩展。
面向数据与分析工程师的dbt原生数据可观测性解决方案。在数分钟内监控您的数据管道。可作为自托管或具有高级功能的云服务使用。
🔮 Instill Core 是一个全栈 AI 基础设施工具,用于数据、模型和管道编排,旨在简化构建多功能 AI 优先应用的各个方面。
基于SAG构建的文档检索项目
Feathr – 面向企业的可扩展统一数据与AI工程平台
快速高效的非结构化数据提取。用Rust编写,支持多种语言的绑定。
面向大语言模型的可扩展数据预处理与整理工具包
MLRun 是一个开源 MLOps 平台,用于快速构建和管理整个生命周期中的连续 ML 应用程序。MLRun 集成到你的开发和 CI/CD 环境中,并自动化生产数据、ML 管道和在线应用程序的交付。
用于构建数据湖、数据仓库和分析平台的端到端GoodReads数据管道
面向构建者和黑客的开放文档智能平台——面向智能体世界的文档管理系统
一个全面的Python包模板,用于快速启动和标准化你的MLOps项目和数据管道。
开源本地优先的 ETL/ELT 工作室:可视化数据管道、290+ 连接器、dbt 和本地 AI,运行于 DuckDB 之上。
使用 SQL Server 构建现代数据仓库的综合指南,包括 ETL 流程、数据建模和分析。
更智能的音频数据管道
Neum AI是一个一流的框架,用于管理大规模向量嵌入的创建和同步
社区驱动、简单而强大的框架,用于快速、经济高效的数据分布式计算
一个可扩展的通用微框架,用于定义数据流。此仓库已移至 www.github.com/dagworks-inc/hamilton
Google Cloud Dataflow 提供了一个简单而强大的模型,用于构建批处理和流式并行数据处理管道。
用于构建高效数据管道的 Python 框架。它促进模块化和协作,能够从简单、可重用的组件创建复杂的管道。
一体化文本去重
Optimus是一个易于使用、可靠且高性能的工作流编排器,用于数据转换、数据建模、管道和数据质量管理。
更好地了解你的数据!Datavines 是下一代数据可观测性平台,支持元数据管理和数据质量。
开源端到端计算机视觉平台。在统一平台上进行标注、构建、训练、调优、部署和自动化,支持任何云和本地环境。
R语言中的高级快速数据转换。
🍁 Sycamore 是一个基于 LLM 的非结构化数据搜索和分析平台。
Genblaze 是一个开源 Python SDK,用于编排跨视频、音频和图像提供商的生成式 AI 媒体管道,每个输出都内置来源追踪。
用于渲染合成纸张打印、传真、扫描和复印机过程的增强流水线
Desbordante是一个高性能数据剖析器,能够使用各种算法发现数据中的许多不同模式。它还允许使用这些算法运行数据清洗场景。Desbordante有一个控制台版本和一个易于使用的Web应用程序。
Polyaxon的谱系元数据API、工件流、沙箱、API和空间
生产就绪的数据处理,简单且可共享
FeatHub - 用于实时机器学习的流批统一特征存储
基于Python的开源ETL工具,用于文件爬取、文档处理(文本提取、OCR)、内容分析(实体提取和命名实体识别)和数据增强(标注)流程,以及导入Solr或Elasticsearch索引和链接数据图数据库。
Radient将多种数据类型(不仅仅是文本)转化为向量,用于相似性搜索、RAG、回归分析等。
生产级PostgreSQL扩展,用于在后台工作进程中执行任意SQL——支持异步执行、自治事务、cookie保护句柄、取消、进度报告和可观测性。
构建现代数据栈并编排工作流,为分析和机器学习应用创建高质量数据。
将你的Pythonic研究转化为工程师可轻松部署的产物。
在 Rust 中实现快速、最小化且符合人体工程学的零拷贝 Apache Arrow 表格数据,包含 PyO3、Python 绑定、共享内存和低延迟 SIMD,适用于数据工程和列式工作负载。通过 FFI 轻松桥接到 Polars 和 Arrow-rs。
用于Python的C++加速数据质量工具包:CSV解析、清洗、模式验证、分析和pandas集成。
Prosto 是一个数据处理工具包,通过高度依赖函数及函数操作(作为 map-reduce 和 join-groupby 的替代方案)从根本上改变数据处理方式。
🦆 使用Airflow、DuckDB、Delta Lake、Trino、MinIO和Metabase的批量数据流水线。完全可观测性和数据质量。
一个模式感知的 Scala 数据转换库
基于LRS3数据集的多模态语音分离任务数据生成脚本。
Prism 是在 Python 中开发、编排和执行数据管道的最简单方式
专注于性能、一致性和可扩展性的数据流运行时。用Rust或WASM编写插件,并在数据保证下处理数据。
Beneath 是一个无服务器实时数据平台 ⚡️
PyData NYC 2024 会议中“使用 Python、Docker 和 GitHub Actions 部署与监控机器学习管道”研讨会的材料
Apache Spark 的 PDF 数据源,支持直接读取 PDF 文件到 DataFrame 并进行 OCR
mloda.ai - 面向AI和ML的开放数据访问。基于插件。可追溯。框架无关。
面向LinkML数据模型的数据转换框架
面向SPARQL后端的本体驱动链接数据处理器和服务器。Apache许可证。
一个用于构建、维护和分析图数据的声明式框架。
高性能开源合成数据引擎。使用LLM进行模式设计,利用向量化NumPy进行确定性、可扩展的生成
用于机器翻译及其他自然语言处理任务的平行语料和单语语料过滤与清洗工具。
数据来源:GitHub API · 人工精选 · 实时同步