博客
模型测评与对比
最新 AI 模型的实测与对比,来自在生产环境路由这些模型的团队。

阅读时间 11 分钟
2026 年最佳编程 LLMs:按任务和总成本来选
按任务成功率、Agent 可靠性、延迟和成本,比较 Claude、GPT、Gemini 与 DeepSeek,选出 2026 年适合你的编程 LLM。

阅读时间 6 分钟
Qwen3.8-Max:2.4T 参数、零 benchmark — 哪些是真的,哪些还只是发表会上的话
阿里 Qwen3.8-Max 已开放预览:2.4T 参数、多模态,但截至目前没有任何公开 benchmark、没有 model card、开源时间已跳票。一个中立网关的核对:已确认 vs 声称 vs 缺失,以及怎么用一把 key 把 qwen3.8-max 和 Claude、GPT、Gemini、DeepSeek 放在一起自己测。