AI数据工程工具
241 个模型按数据工程排名。 评分包含以下额外加分: JSON mode (structured schemas), reasoning (query optimization), function calling (pipeline orchestration), large context和large output.
排名方式: 基于基准测试分数(90%)来自MMLU、GPQA、HumanEval、SWE-bench等15+标准化评估,能力和上下文窗口作为辅助排序(10%)。
241
总排名
214
JSON模式
241
推理
234
函数调用
AIData Engineering模型 - 按评分排名
| # | 模型 | 评分 |
|---|---|---|
| 1 | Claude Fable 5Anthropic | 97 |
| 2 | Claude Fable 5 (batch)Anthropic | 97 |
| 3 | Claude Opus 5 (Fast)Anthropic | 95 |
| 4 | Claude Opus 5Anthropic | 95 |
| 5 | Claude Opus 4.8 (Fast)Anthropic | 95 |
| 6 | Claude Opus 4.8Anthropic | 95 |
| 7 | Claude Opus 4.7 (Fast)Anthropic | 95 |
| 8 | Claude Opus 4.7Anthropic | 95 |
| 9 | Claude Opus 4.7 (batch)Anthropic | 95 |
| 10 | Claude Opus 4.8 (batch)Anthropic | 95 |
| 11 | GPT-5.5 ProOpenAI | 93 |
| 12 | GPT-5.5 Pro (batch)OpenAI | 93 |
| 13 | GPT-5.5OpenAI | 93 |
| 14 | GPT-5.5 (batch)OpenAI | 93 |
| 15 | Gemini 3.1 Pro Preview Custom ToolsGoogle | 92 |
| 16 | Gemini 3.1 Pro PreviewGoogle | 92 |
| 17 | Gemini 3.1 Pro Preview (batch)Google | 92 |
| 18 | GPT-5.4 ProOpenAI | 92 |
| 19 | GPT-5.4 Pro (batch)OpenAI | 92 |
| 20 | GPT-5.4OpenAI | 92 |
| 21 | GPT-5.4 (batch)OpenAI | 92 |
| 22 | GPT-5.3-CodexOpenAI | 91 |
| 23 | GPT-5.2-CodexOpenAI | 91 |
| 24 | GPT-5.2 ProOpenAI | 91 |
| 25 | GPT-5.2 Pro (batch)OpenAI | 91 |
| 26 | GPT-5.2OpenAI | 91 |
| 27 | GPT-5.2 (batch)OpenAI | 91 |
| 28 | Claude Opus 4.6Anthropic | 90 |
| 29 | Claude Opus 4.6 (batch)Anthropic | 90 |
| 30 | GPT-5.6 Luna ProOpenAI | 89 |
AI数据工程应用场景
SQL 与 Query 生成
生成复杂SQL查询、dbt模型和数据转换。JSON模式确保自动化流水线集成的结构化输出。
Schema 设计 与 Migration
设计数据仓库架构、创建迁移脚本和管理演进的数据模型。推理模型优化查询性能和规范化。
Pipeline Orchestration
生成Airflow DAG、Prefect流和Dagster资产。函数调用支持与编排API和元数据目录集成。
Data Quality 与 测试
创建数据质量检查、Great Expectations套件和验证规则。大上下文窗口处理完整的架构文档以进行全面测试。
Frequently Asked Questions
模型可以为Apache Spark、dbt、Airflow和Prefect生成ETL/ELT代码。推理处理复杂的转换逻辑和数据质量规则。函数调用与数据目录API集成。
可以,顶级模型生成PySpark和Spark SQL代码、优化连接策略并调试序列化错误。推理对理解分布式计算模式至关重要。
JSON模式输出与Great Expectations和dbt测试兼容的结构化数据质量规则。推理识别边缘情况和数据异常。
模型设计维度模型、实现缓慢变化维度并生成具有适当物化策略的dbt模型。它们理解Snowflake、Databricks和BigQuery架构之间的权衡。