- 最高票数
- 200
- 最佳排名
- #6
- 上榜次数
- 2 次
- 最近上榜
- 2025.12.21
产品介绍
大多数人工智能基准测试的构建方式是反向的。有人坐下来,想出一些难题,然后测量智能体解决这些问题的能力。虽然结果很有趣,但它们并不总能反映出真正重要的内容:即智能体在你手头实际工作中的表现。这就是我们创建cto.bench的原因。与其依赖假设性任务,我们的基准测试是基于真实的工作。cto.bench上的每一个数据点都直接来自于cto.new用户在我们平台上的实际使用情况。

- 基准测试
- 人工智能基准
- 真实工作
- 性能评估
- 数据点
- 用户使用
- 实际任务
- 代码代理
- AI性能
- 工作负载
- 测试标准
