- 最高票数
- 286
- 最佳排名
- #2
- 上榜次数
- 7 次
- 最近上榜
- 2026.01.24
产品介绍
Forge能够自动将PyTorch模型转换为优化后的CUDA和Triton内核。它会并行运行32个AI智能体,每个智能体尝试不同的优化策略,比如张量核心、内存合并和内核融合。在基准测试之前,系统会由一个评审者对每个内核的正确性进行验证。我们在Llama 3.1 8B模型上的推理速度比torch.compile快了5倍,而在Qwen 2.5 7B模型上快了4倍。Forge适用于任何PyTorch模型。提供一个内核的免费试用。如果我们的性能没有超越torch.compile,还可以全额退款。

- PyTorch
- CUDA
- Triton
- 优化
- 内核
- AI代理
- 并行计算
- 张量核心
- 内存合并
- 内核融合
- 推理速度
- Llama 3.1
- Q
