Arena

3小时前发布 3 0 0

Arena(原 LMArena/Chatbot Arena)是由 UC Berkeley 研究团队创建的 AI 模型公开评测平台,通过人类盲测投票对 LLM 进行 Elo 排名,覆盖文本、代码、图像、视频等多模态 Leaderboard,月活用户超 500 万。

收录时间:
2026-08-10

Arena - AI模型公开评测平台,人类盲测投票、Elo排名与多模态Leaderboard

Arena 简介

Arena(原 LMArena/Chatbot Arena)是由 UC Berkeley 研究团队创建、现由 Arena Intelligence 运营的 AI 模型公开评测平台,定位为"AI 模型的公开选举"。平台通过人类盲测投票机制对大型语言模型(LLM)进行排名:用户输入一个提示,两个匿名模型并排回答,用户投票选择更好的回复,投票后才揭晓模型身份。数百万次成对投票通过 Elo/Bradley-Terry 评分系统生成实时 Leaderboard,已成为技术买家、开发者、记者评估模型实际表现时最常引用的公开基准。2026 年 1 月正式从 LMArena 更名为 Arena,月活用户超 500 万,覆盖 150 个国家,每月处理约 6000 万次对话。

Arena 核心功能/服务

盲测并排投票机制:用户输入提示后,两个匿名模型并排生成回复,用户根据回复质量投票。投票后才显示模型身份,避免品牌偏见。数百万次真实人类偏好投票通过 Elo/Bradley-Terry 评分系统生成实时排名,反映模型在实际使用中的表现而非实验室分数。

多模态 Leaderboard 覆盖:从纯文本聊天扩展到代码(Code Arena)、视觉(Vision Arena)、文档处理、搜索、图像生成、图像编辑、视频生成等多模态评测。文本 Arena 收录 339+ 模型,Code Arena 收录 60 模型,图像与视频 Arena 持续扩充,为不同应用场景提供细分排名参考。

直接聊天与模型探索:除投票模式外,用户可直接与平台上的数十种专有与开源模型进行一对一聊天,无需分别注册多个平台账户即可体验不同模型的回复风格与能力边界。免费使用,无需账户即可进行基本投票与聊天。

Arena 适合谁

  • AI 模型选型决策者:需要在多个 LLM 之间做出采购或集成决策的技术负责人与产品经理,可通过 Arena 的实时排名与盲测数据,了解当前人类用户实际偏好的模型,缩小候选范围后再进行自有场景测试。
  • AI 研究者与开发者:从事模型训练、微调或评估的研究人员与工程师,可参考 Arena 的公开数据集与偏好数据,了解模型在实际对话中的表现差距,指导优化方向。
  • 希望快速对比多个模型的用户:想体验 Claude、GPT、Gemini、DeepSeek 等多种模型但不愿分别注册的用户,可通过 Arena 的直接聊天功能,在一个平台内对比不同模型的回复质量与风格差异。

为什么选择 Arena

Arena 的核心优势在于"真实人类偏好"而非"自动化基准"——与 MMLU、HumanEval 等静态测试不同,Arena 的评分来自真实人类对真实提示的实际偏好,更能反映模型在 tone、instruction-following、refusals 等自动化测试难以捕捉的维度上的表现。规模庞大(文本 Arena 超 580 万票),统计显著性高。免费公开,无付费墙。多模态覆盖从文本到代码到图像到视频,适应 AI 能力边界的持续扩展。作为 UC Berkeley 背景的研究项目,方法论经过学术验证。对于需要了解"哪个模型在实际使用中表现最好"的任何人,Arena 是最权威的公开参考之一。访问 Arena 官网,参与 AI 模型的公开盲测投票。

数据统计

关于(Arena)特别声明

本站商娱网提供的Arena都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由商娱网实际控制,在2026-08-10 10:55收录和巡查时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,商娱网不承担任何责任。

相关导航

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...