Kimi K3 自部署
376 字
2 分钟
Kimi K3 自部署
来吃螃蟹


主机配置:
- 4TB RAM
- 16TM NVME SSD
- 8X B300
- 2x Intel Xeon 6767p(256 逻辑核心)
参数:
参考 Kimi-K3 - SGLang 文档 进行了些微调
SGLang 还加上了 DSpark

安装
截止发帖时间,Kimi K3 的支持还没合并到主分支当中,这里使用的是 sgl-project/sglang at kimi-k3
clone 下来需要使用 nightly index 安装
pip install \ --extra-index-url https://sgl-project.github.io/whl/cu130/ \ --extra-index-url https://download.pytorch.org/whl/cu130 \ --index-strategy unsafe-best-match \ -e "python[all]"还需要安装 ffmpeg 来实现图像解码,最简单是直接 LD_LIBRARY_PATH 到 site-packages/PyNvVideoCodec,sglang/docker/kimi_k3 at kimi-k3 · sgl-project/sglang 这里还藏了一些 patch,如果不用 docker 记得把补丁打上
启动
这里用的是 Low Latency + DSpark + HiCache 版本
sglang serve \ --tokenizer-backend fastokens \ --trust-remote-code \ --model-path moonshotai/Kimi-K3 \ --served-model-name k3 \ --tp-size 8 \ --enable-symm-mem \ --mem-fraction-static 0.85 \ --reasoning-parser kimi_k3 \ --tool-call-parser kimi_k3 \ --mamba-full-memory-ratio 0.86 \ --host 0.0.0.0 \ --speculative-algorithm DSPARK \ --speculative-draft-model-path RadixArk/Kimi-K3-DSpark \ --speculative-dspark-block-size 7 \ --enable-linear-replayssm-spec \ --enable-hierarchical-cache \ --hicache-size 150 \ --model-loader-extra-config {"enable_multithread_load":true,"num_threads":64} \ --weight-loader-prefetch-checkpoints \ --weight-loader-prefetch-num-threads 64 \ --enable-nccl-nvls \ --pre-warm-nccl基本就是官方 Low Latency 参数,只不过加了点加载 checkpoint 优化,方便调试参数
如果你以前部署过其他模型,hicache 记得砍半,mamba 和 hicache 是同时占用的 也就是说 hicache size 实际上会翻两倍
Benchmark:

总体来看,好像比 SGL 官方用 GB 300 跑得慢了 100 TPS 左右 不知道是不是哪里补丁又没打上 回去再看看
Update 1:
终结,换回 GLM 5.2,K3 单机太卡了,没啥用
现在 SGLang 的 Kimi Kernel 非常不稳定,4-5 小时必崩溃
部署 GLM5.2 的文章 https://blog.aeroides.dev/posts/2026/post1/deploy-glm-on-h100-h200-b300/
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!
相关文章智能推荐
1
Kimi K3 使用体验及 Allegro 额度
技术Kimi K3 使用体验及 Allegro 额度
2
在 H100/H200/B300 上部署 GLM
技术在 H100 H200 B300 上部署 GLM
3
Factory Droid Max Plan 体验
技术Factory Droid Max Plan 体验
4
ChatCodex - 将 Codex APP Server 变为 MCP 工具的本地 AI 网关
技术ChatCodex 是一个本地 AI 网关,将 Codex APP Server 变成可调用的 MCP 工具,深度接入 ChatGPT 生态。
5
Devin + SWE 1.7/GLM 5.2 初体验
技术Devin + SWE 1.7/GLM 5.2 初体验
随机文章随机推荐





