荒岛广告位招商进行中...
荒岛广告位招商进行中...
荒岛广告位招商进行中...

AI 大模型文本生文本能力排行

共收录 0 款模型评估数据
排行榜指标含义说明
综合学科知识
Intelligence Index 综合 综合能力指数,汇总推理、代码、知识等多维度核心权重的综合评级。
GPQA 知识 Google-Proof Q&A 前沿科学数据集(生物、物理、化学),测试专家级推理能力。
MMLU Pro 学科知识 包含多学科高难度选择题的基准测试,更加注重复杂逻辑推理和少样本能力。
HLE 评估 Humanity's Last Exam(人类最后的考试),专为评估前沿 AI 模型上限设计的极高难度基准。
代码编程能力
Coding Index 代码 代码能力综合指数,反映模型在代码生成、重构和问题排查上的整体表现。
LiveCodeBench 代码 基于 LeetCode、AtCoder 等平台实时更新的新题测试,防止模型过度拟合/背题。
SciCode 代码 科学计算和自然科学问题代码化能力的评估集。
LCR 代码 长文本/复杂上下文代码阅读和推理(Long-Context Reasoning Code)测试。
TerminalBench Hard 命令行 测试模型在真实 Linux 终端中通过 Shell 指令解决高难度系统运维和开发任务的能力。
数学推理能力
Math Index 数学 数学综合指数,衡量模型从基础代数到高阶竞赛题的数学能力。
Math 500 数学 从 MATH 数据集中精选的 500 道代表性高难度数学题。
AIME / AIME 2025 数学 美国数学邀请赛(AIME)真题测试,衡量顶尖竞赛级别的数学推理水平。
指令和 Agent 能力
IFBench 指令遵循 评估模型严格执行复杂格式、限定字数和多重条件约束指令的能力。
Tau2 综合 测试大模型作为智能体(Agent)在多轮对话和复杂工具调用场景下的交互能力。
图像和视频生成能力
ELO 积分 基于盲测(Blind Test)和人类偏好对战评估得出的 ELO 竞技积分,分值越高表示生成的图像/视频越受欢迎。
CI95 置信区间 基于 95% 置信度计算的 ELO 分数波动范围误差(如 -8/8 表示得分在上下 8 分范围内评估有效)。
性能体验和价格
输出速度 (tokens/s) 模型生成文本的平均速率(每秒生成的 Token 数)。
首token时间 / 首答案token时间 TTFT(Time To First Token),分别对应首次响应延迟以及深度思考模型输出最终答案首字的时间。
价格 - 输入/输出 百万 Token 的官方 API 调用价格(包含 Prompt 接收和文本生成)。