XSCT_Bench_Dataset

面向 AI 产品落地的场景化模型评测数据集

Python MIT License 洛小山出品

项目简介

不选最强的,选最合适的。XSCT LM Arena 平台使用的评测数据集开源版本,包含 886 条覆盖文字生成、图像生成、网页生成三大方向的测试用例,每条用例含 Basic / Medium / Hard 三个难度级别。文字生成 25 个维度(Agent MCP、代码、幻觉控制、批判性思维等)、图像生成 25 个维度、网页生成 13 个维度,帮你评估模型在真实产品场景下的表现。

886 条用例 三大方向 场景化评测 模型选型 开源数据集

核心特性

快速开始

# 克隆仓库 git clone https://github.com/itshen/XSCT_Bench_Dataset # 进入目录 cd XSCT_Bench_Dataset # 安装依赖 git clone https://github.com/itshen/XSCT_Bench_Dataset # 启动项目 # 数据集为 JSON 格式,可直接加载使用

关于作者

洛小山

洛小山

AI 产品总监,专注 AI 产品战略与落地。更多工具请关注公众号【洛小山】

更多开源项目