广告

Qwen3.8 Max重测后追平Opus 4.8

发布日期:2026-08-07 11:10 阅读:
8月7日消息,评测机构 Artificial Analysis 重测 Qwen3.8 Max 后,将其 Intelligence Index 从 53 分上调到 56 分。此前测试接口出现间歇性异常,这次改用阿里云官方 API 重跑。新成绩追平 Claude Opus 4.8,但仍比 Kimi K3 低 1 分。
千问进步最明显的是 Agent 任务。GDPval-AA 得分达到 1739,超过 Kimi K3 的 1685 和 GPT-5.6 Sol 的 1730,仅落后 Claude Opus 5。终端操作、科学推理和编程评测也普遍上涨。
代价是更费 Token。Qwen3.8 Max 的 Token 单价比上一代更低,但完成一道综合评测任务的平均成本,仍从 0.53 美元涨到 1.14 美元,高于 Kimi K3 的 0.86 美元。主要原因是它在 Agent 任务中调用更多轮次,生成的内容也更多。
它的知识可靠性还出现倒退。AA-Omniscience 准确率基本没变,幻觉率却从上一代的 23% 升到 40%。

发表我的意见

4364

文章

0

提问

410万+

阅读量

0

回答

35万+

被赞

0

余额

关于我们 联系我们 加入我们 免责声明 版权声明 Sitemap 标签Tag 侵权删除:8512807@qq.com 微信:Suipai8888 Investor Relations © 2026 穗牌官网 广州穗牌电动车有限公司版权所有 粤ICP备2024261588号 增值电信经营许可证:粤ICP备2024261588号