InfiniTensor
用户4452
添加快捷方式
分享
智能加速卡测评方案
输入“/”快速插入内容
智能加速卡
测评方案
用户4452
用户4452
用户2019
用户2019
用户4794
用户4794
2025年11月21日修改
一、
评测目标与原则
本测评体系旨在建立一套全面、科学、公正的人工智能
加速卡
评估标准。体系设计紧扣当下人工智能计算需求的发展趋势,从基础性能、可用性、能效比三大核心维度出发,系统化衡量硬件平台在支撑模型训练、推理以及传统模型任务时的综合表现,为训推一体场景提供一致、全面的量化指标体系。评测原则如下:
1.1 公平性(黑盒原则)
所有评测均采用统一的、内部定义的输入数据与测试配置,不公开具体输入输出、算子规模或批处理设定,确保不同平台比较的客观公平性。
1.2 可复现性
评测流程、指标定义、判断标准均采用规范化设计,使任何平台在标准化环境中均可重复得到一致结果。
1.3 全面性
覆盖算子级、框架级、端到端训练、端到端推理及能效表现,适用于大模型与传统模型的典型工作负载。
二、
评测范围与对象
本体系覆盖常见的人工智能任务类别,包括:
2.1 大规模语言模型(LLM)
覆盖从中等规模到超大规模(数十亿至数百亿以上参数)的自回归语言模型。对应任务包括:
•
无监督预训练
场景
•
全参
有监督精调
场景
(SFT)
•
低资源精调场景
(LoRA)
•
推理服务化
场景
(高并发/大上下文)
2.2
传统
模型
本环节旨在评估系统对多样化深度学习架构的通用支持能力,测试范围覆盖计算机视觉、自然语言处理及推荐系统等核心领域:
1.
计算机视觉 (CV)
◦
任务
:图像分类、目标检测、图像分割
等
2.
自然语言
处理
(NLP)
◦
任务
:文本分类、
对话问答
、机器翻译
等
3.
语音与时序 (Speech & Audio)
◦
任务
:语音
识别、时序预测等
4.
推荐系统 (RecSys)
◦
任务
:点击率预测 (CTR)
2.3 计算与框架支持范围
测评涵盖:
•
主流训练框架
:
PyTorch、Megatron-LM 等
•
主流推理框架
:
vLLM 等
•
主流领域特定语言(DSL)
:
Triton
•
自研九源训练框架
:
InfiniTrain
•
自研九源推理框架
:
InfiniLM
•
自研九源领域特定语言框架
:
NineToothed (九齿)
评测不依赖公开的模型输入,具体测试模型、配置与输入由内部统一黑盒生成。
三、
基础性能
测评
3
.1 单卡绝对性能
单卡绝对性能取加速卡浮点运算能力(FLOPS),即加速卡每秒实际可执行的浮点运算次数。
场景设定
基础性能测试旨在评估芯片在典型
智能计算
任务中的计算能力,覆盖训练和推理场景。测评对象包括大模型和
传统
模型中常见的计算模块,既包括基础算子,也包括融合算子,以全面反映芯片的综合性能表现。
为达成此目标,通过专业的底层计算接口,对上述关键算子进行基准测试。通过多次运行取平均耗时,并结合计算问题规模,计算出实际 FLOPS 值,测试算子基于主流模型架构中的计算瓶颈和高频操作进行遴选,确保评测结果具有高度的代表性和实际参考价值。
测试设定
测评选取典型算子作为测试对象,典型算子主要指在不同模型中通用的基础计算模块,以及在单一模型中计算量占比较高的核心算子。以大模型推理为例,当前主流大模型均以 Transformer 结构为基础,其中矩阵乘法(MatMul/GEMM)是计算量最集中的核心算子。此外,推理过程中还包含一类以归约(reduce)操作为主的算子,如 RMSNorm、Softmax,以及执行激活与掩码操作的函数(如 SiLU、ReLU)和位置偏置计算算子等。因这些算子在不同阶段对性能均有显著影响,所以均纳入测试范围。
评价指标
指标类型
指标名称
指标说明
兼容性指标
算子兼容性
程序无编译及运行时错误,算子 kernel 能够正常启动
性能指标
延迟(ms)
执行一次算子运算的平均耗时
算力(FLOPS)
单位时间内执行浮点操作的数量
精度指标
算子精度
在相同计算设备上,与 PyTorch 运行结果逐 Tensor 元素对比,得到绝对误差与相对误差