Colibri 入门:在磁盘、内存与显存之间加载 MoE 专家
Colibri 基准方法:冷缓存、专家块与可复现对比
依据上游协议,避免把页缓存速度当成模型或磁盘的真实性能。
Colibri 基准方法:冷缓存、专家块与可复现对比知识学习CN编辑简报更新 2026-09-23
你将学会
- 描述实际工作点
- 加入独立对照
- 联合报告质量和成本
开始前需要
- 基本 Python 与命令行知识
- 明确的硬件与存储清单
先建立可复现记录,再尝试新的推理优化。
先看结论
- 热缓存必须明确标注。
- I/O 形状影响结论。
- 已撤回解释不能继续当事实。
描述实际工作点
记录模型、容器、提交、硬件、提示词和 token 数。说明如何建立冷缓存,或明确标注热缓存,不能把热缓存测量包装成原始磁盘带宽。
匹配请求大小、对齐、队列深度以及缓冲或直接 I/O。小块 QD1 与大型专家块读取即使在同一块硬盘,也是在测量不同工作点。
加入独立对照
协议要求增加应当稳定的校验指标。后台构建、第二个引擎进程或温度漂移,都可能产生看似可信、实际误导的吞吐变化。
文档保留了受控复测未能支持的对齐机制解释及撤回记录。不能把已撤回的原因继续作为优化事实,也不能把一台主机结果推广为普遍规律。
联合报告质量和成本
交替运行基线与候选配置,每次只改一个变量,保留失败和波动。测量首 token 延迟、吞吐、读取字节与质量,硬件和用电成本来自实际环境。
本系列没有执行基准,表格故意留空。上游结果保持为有归属的观察,而不是本机速度保证;未测量的数据不应补成漂亮的提升百分比。
如何选择
| 比较维度 | 方案 A | 方案 B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
实施步骤
- 1
登记模型、硬件与缓存。
- 2
匹配 I/O 并设置独立对照。
- 3
重复单变量试验并保留负结果。
可复制示例
csv
trial,model,format,cache_state,request_size,queue_depth,ttft,tokens_per_second,bytes_read,quality
baseline,,,,,,,,,常见问题
SSD 峰值能预测生成速度吗?
不能可靠预测,还需匹配负载、缓存与计算条件。
表格里是实测结果吗?
不是,它用于未来受控实验。
资料来源
- Colibri / docs/benchmarking.md来源核查 2026-09-23
- Colibri / README.md来源核查 2026-09-23