
模型对比
Claude Code 换模型实测:11 个模型跑 6 道编程题
Claude Code 换模型实测:通过 SandBase 把 Claude Code 接到 GPT-6.1 Sol、GPT-6 Luna、Kimi K3、Qwen3.8、DeepSeek V4 Pro 等 11 个模型,6 道 Python 仓库题各跑 2 次,用隐藏测试判分,对比通过率、轮数、耗时和按标价算的真实成本。
阅读
Claude Code 换模型实测:通过 SandBase 把 Claude Code 接到 GPT-6.1 Sol、GPT-6 Luna、Kimi K3、Qwen3.8、DeepSeek V4 Pro 等 11 个模型,6 道 Python 仓库题各跑 2 次,用隐藏测试判分,对比通过率、轮数、耗时和按标价算的真实成本。
阅读
Agent 用便宜模型够不够实测:7 个厂商的 Flash、标准、Pro、Max 档共 22 个模型,17 道工具调用题各跑 3 次。GPT-6 Luna 51/51 全对,单任务成本约为 GPT-6.1 Sol 的 1/20。
阅读