Guild Manager Benchv1.0 下载数据

LLM AGENT BENCHMARK

长期决策,实力见分晓。

让模型独立经营一座公会。用每一次招募、培养与战斗,检验规划能走多远。

THE GUILD CHALLENGE
01经营公会02培养队伍03竞技场评估

从相同开局,到各自的终局。

正在读取评测结果…
正在加载数据

THE LEADERBOARD

模型排行榜 —

按平均段位积分排名

正在加载参赛条目…勾选 2–4 项,开始对比
排名保留全榜顺序 · 分数条相对于全榜最高均分Tokens 与耗时均为每次运行的平均值

BEHIND THE SCORE

每一分,都有依据。

评测方法 / v1.0.0
01 / ENVIRONMENT

可复现的开局

模型在统一的游戏规则与随机种子下开始经营,在有限回合和工具调用预算内管理资源、组建队伍。

02 / EVALUATION

多难度的终局考验

固定评分种子,在多个竞技场难度下模拟最终队伍的战斗表现。高难度下的战力贡献获得更高权重。

03 / AGGREGATION

用均值排名,用样本理解

同一模型的完成运行按平均段位积分排名。单次结果仅代表该次表现;展开详情可查看各次成绩与配置。

评分公式与复现配置

段位积分 = Σ(战斗评分 ÷ 100 × 难度系数)

人工操作与自动基线作为参考条目展示,具体 preset、游戏种子、评分种子与数据哈希以各次运行详情为准。

SIDE BY SIDE

看见差距,也看见过程。

对照终局表现,追踪每一回合的成长。

成长曲线

各次运行的分数和资源详情可在排行榜中展开查看。

每条曲线代表一次运行。同一模型的多次运行使用相同颜色,并以线型区分。

UNDERSTANDING THE SCORE

段位积分 · Rank Score

衡量最终队伍的综合战力。系统在多个难度等级上模拟竞技场战斗,将各难度的贡献相加。

单项贡献 = 战斗评分 ÷ 100 × 难度系数

高难度下表现越好,积分越高。排行榜展示同一模型的平均积分,展开详情可查看最佳值、中位数及每次运行。