隐藏模型名称后更容易看清回答本身
Arena 的核心体验是把两个模型放在同一问题下匿名作答,用户先选择更好的结果,之后才揭晓模型名称。这个顺序能减少品牌和排行榜带来的先入为主,对写作、代码解释、资料归纳或图像生成等主观任务尤其有价值。
我测试时不会只问一个知识题,因为模型可能碰巧记住答案。更有效的方法是连续使用三类输入:自己熟悉且能核对的事实、需要遵守多项限制的任务,以及带有含糊条件的真实需求。这样才能看到准确、遵循指令和主动澄清之间的差别。
让对战结果服务于自己的选型
公共排名汇总了大量偏好,但它不能直接代表你的业务。把常用任务改写成不包含隐私的测试题,每轮先写下判断标准,再阅读回答。否则很容易因为文字更长或语气更自信,误把表达能力当成事实质量。
- 事实任务逐项核对来源、日期和数字;
- 写作任务比较结构、受众匹配和可编辑程度;
- 代码任务运行测试,不只看语法是否漂亮;
- 记录模型揭晓结果,观察偏好是否长期稳定。
公共评测也有看不见的偏差
平台上的参与者、提示语言和热门任务会影响排名,模型版本也可能随时间更新。某个模型在总体榜单领先,不代表它更适合中文长文、特定编程语言或你的行业资料。将 Arena 当作发现候选模型的入口,比把名次当作采购结论更稳妥。
匿名对战页面适合公开、可重复的问题,不应粘贴客户资料、未公开代码或个人信息。需要在账号内完成日常工作时,可分别查看本站整理的 ChatGPT 与 Claude 官方入口和使用边界。
最有用的结果是发现自己在意什么
连续比较几轮后,往往会发现自己真正重视的是引用是否可靠、格式能否直接复用、回答是否简洁,或模型会不会在信息不足时停下来询问。这些标准比单一总分更适合转化成团队测试表。
Arena 已从 LMArena 更名并迁移到新域名,旧教程中的入口可能仍使用原名称。收藏时以当前官方域名为准;若页面提供不同模式,先确认比较的是文字、搜索还是图像模型,避免把不同能力的结果混在一起。
