面向 AI 产品落地的场景化模型评测数据集
不选最强的,选最合适的。XSCT LM Arena 平台使用的评测数据集开源版本,包含 886 条覆盖文字生成、图像生成、网页生成三大方向的测试用例,每条用例含 Basic / Medium / Hard 三个难度级别。文字生成 25 个维度(Agent MCP、代码、幻觉控制、批判性思维等)、图像生成 25 个维度、网页生成 13 个维度,帮你评估模型在真实产品场景下的表现。
886 条测试用例来自真实产品场景,而非学术刷榜题目。
覆盖文字生成(362 条)、图像生成(343 条)、网页生成(181 条)。
每条用例含 Basic / Medium / Hard 三个难度级别,精细刻画模型能力边界。
完整评测结果与模型排行可在 xsct.ai 在线查看。
# 克隆仓库
git clone https://github.com/itshen/XSCT_Bench_Dataset
# 进入目录
cd XSCT_Bench_Dataset
# 安装依赖
git clone https://github.com/itshen/XSCT_Bench_Dataset
# 启动项目
# 数据集为 JSON 格式,可直接加载使用