中文大模型基准测评2025年上半年报告.pptxVIP

  • 0
  • 0
  • 约3.1千字
  • 约 60页
  • 2026-10-08 发布于江苏
  • 举报

中文大模型基准测评2025年上半年报告.pptx

;精准量化通用人工智能(AGI)进展,定义人类迈向AGI的路线图;;3;o3以73.78的总分取得总榜第一,领跑全球。

海外头部模型o3、o4-mini(high)和Gemini-2.5-Pro在本次七月通用基准测评中取得了

73.78分、73.32分和68.98分的总成绩,分别位于榜单前三。Doubao-Seed-1.6-thinking-250715以68.04的总分取得国内第一、全球第四的成绩。

国内外头部模型之间的差异较大,海外模型在推理任务上的优势尤其明显。

海外模型在推理任务上的优势尤其显著,o3和o4-mini(high)在推理任务上分别取得了75.02和72.68的分数,领跑推理任务榜单。国内推理任务成绩最好的模型分别是DeepSeek-R1-0528和Doubao-Seed-1.6-thinking-250715,均有超过65分的表现,但与海外头部模型依旧相差近10分。

国内开源模型相较于海外开源模型优势显著。

DeepSeek-R1-0528、Qwen3-235B-A22B-Thinking-2507和GLM-4.5分别以66.15分、64.34分和63.25分取得了开源榜单的前三名,海外开源模型最好成绩仅有46.37分,与国内开源模型最好成绩相差近20分,国内开源模型的优势显著。

国内大模型在智能体Agent和幻觉控制任务上的表现

文档评论(0)

1亿VIP精品文档

相关文档