Benchmark Report · 2026Q3
SparkInfer 消费级 GPU 性能报告
面向 Token / Talk 工厂与桌面推理场景的方法与边界说明:同权重 Runtime A/B、复测要求、PoC 准备项。完整跑分表与原始条件不公网挂载。
发布:2026-07-31
发布方:Chainfir
性质:方法页 · 非 SLA · 分数邮件发放
一句话结论(可引用)
消费级 GPU 上可将定制 Runtime 作为可替换引擎做同机 A/B;任何 tok/s 或加速比仅在客户卡型 × 模型 × 量化 × 负载协议复测后写入 SOW。公网只讲方法,不挂分数表。
Method and retest gates only on the public web; score tables by email / NDA.
报告覆盖什么(无具体分数)
- 硬件路径:消费级 NVIDIA GPU(不同 SKU 必须分别测;不得跨卡外推)
- 对比基线:llama.cpp、vLLM 等现网/约定基线(版本写入 SOW)
- 指标维度:吞吐、时延、batching / 多请求、GPU 利用率(完整表邮件发放)
- 工程定位:Runtime 引擎层替换,不是重训,也不是替换客户网关 / 调度
发布边界:业务侧跑分、客户环境结果与完整 PDF 属售前材料;公网摘要页不披露具体数值。需要报告请邮件索取。
PoC 最小环境(Week-1)
- 1× GPU 云主机或工作站 + SSH
- Linux · 约定 CUDA 版本
- 目标模型(常见 GGUF)与现网 baseline
- 负载信息:并发、上下文长度、Serving 场景
边界:示意 ≠ SLA;开源项目引用 ≠ 合同相对方;GeForce 4090/5090 不承诺 GPU Confidential Computing;多卡裸金属 / 平台集成属后续 SOW。
相关页面