返回

LLM / 编程榜

比较模型在编程基准任务上的表现。

更新时间2026年9月15日 19:00
方法已发布基准快照
排名 模型 用量 基准分数模型标识上下文 说明
#1
Claude Fable 5.1 Anthropic
81.6 coding81.6anthropic/claude-fable-5.11.0M Claude Fable 5.1 improves on Claude Fable 5 across the board, with the biggest gains in agentic coding, long-running agentic workflows, a…
#2
GPT-5.6 Sol OpenAI
78.3 coding78.3openai/gpt-5.6-sol-202607091.1M GPT-5.6 Sol 是 OpenAI GPT-5.6 系列中的旗舰模型。它适用于复杂推理、编程和智能体工作流,并且……
#3 78 coding78anthropic/claude-opus-51.0M Claude Opus 5 是 Anthropic 的旗舰模型,适用于高要求的推理、编程和长周期智能体工作。它尤其擅长……
#4
GPT-6 Astra OpenAI
76.9 coding76.9openai/gpt-6-astra1.1M GPT-6 Astra 是 OpenAI 的旗舰模型,适用于高要求的端到端工作。它适用于高级分析、软件工程、深度研究……
#5
Grok 4.6 SpaceXAI
76.8 coding76.8x-ai/grok-4.6500K Grok 4.6 是 SpaceXAI 最智能的模型,在编程、知识工作和 STEM 领域具有前沿性能。
#6
GPT-5.6 Terra OpenAI
76.7 coding76.7openai/gpt-5.6-terra1.1M GPT-5.6 Terra 是 OpenAI GPT-5.6 系列中的均衡模型,定位介于旗舰级 Sol 和注重成本效益的 Luna 之间。……
#7
Claude Fable 5 Anthropic
76.5 coding76.5anthropic/claude-5-fable-202606091.0M Claude Fable 5 是 Anthropic 的 Mythos 级模型,专为自主知识工作和编程而构建。它支持文本、图像和文件……
#8 76.3 coding76.3google/gemini-3.8-flash1.0M Gemini 3.8 Flash 是 Google 最智能的 Flash 模型,相比 3.7 Flash 在软件工程、智能体任务……方面有显著提升
#9
Kimi K3 MoonshotAI
76.2 coding76.2moonshotai/kimi-k31.0M Kimi K3 是 Moonshot AI 的 2.8T 参数开放权重多模态推理模型。它适用于复杂编程、知识工作和……
#10 76.1 coding76.1google/gemini-3.7-flash1.0M Gemini 3.7 Flash 是 Google 的多模态模型,适用于快速智能体工作流、编程和复杂的多步推理。它专为……而设计
#1
Claude Fable 5.1 Anthropic
用量 81.6
基准 coding · 上下文 1.0M

Claude Fable 5.1 improves on Claude Fable 5 across the board, with the biggest gains in agentic coding, long-running agentic workflows, a…

#2
GPT-5.6 Sol OpenAI
用量 78.3
基准 coding · 上下文 1.1M

GPT-5.6 Sol 是 OpenAI GPT-5.6 系列中的旗舰模型。它适用于复杂推理、编程和智能体工作流,并且……

基准 coding · 上下文 1.0M

Claude Opus 5 是 Anthropic 的旗舰模型,适用于高要求的推理、编程和长周期智能体工作。它尤其擅长……

#4
GPT-6 Astra OpenAI
用量 76.9
基准 coding · 上下文 1.1M

GPT-6 Astra 是 OpenAI 的旗舰模型,适用于高要求的端到端工作。它适用于高级分析、软件工程、深度研究……

#5
Grok 4.6 SpaceXAI
用量 76.8
基准 coding · 上下文 500K

Grok 4.6 是 SpaceXAI 最智能的模型,在编程、知识工作和 STEM 领域具有前沿性能。

#6
GPT-5.6 Terra OpenAI
用量 76.7
基准 coding · 上下文 1.1M

GPT-5.6 Terra 是 OpenAI GPT-5.6 系列中的均衡模型,定位介于旗舰级 Sol 和注重成本效益的 Luna 之间。……

#7
Claude Fable 5 Anthropic
用量 76.5
基准 coding · 上下文 1.0M

Claude Fable 5 是 Anthropic 的 Mythos 级模型,专为自主知识工作和编程而构建。它支持文本、图像和文件……

#8
用量 76.3
基准 coding · 上下文 1.0M

Gemini 3.8 Flash 是 Google 最智能的 Flash 模型,相比 3.7 Flash 在软件工程、智能体任务……方面有显著提升

#9
Kimi K3 MoonshotAI
用量 76.2
基准 coding · 上下文 1.0M

Kimi K3 是 Moonshot AI 的 2.8T 参数开放权重多模态推理模型。它适用于复杂编程、知识工作和……

#10
用量 76.1
基准 coding · 上下文 1.0M

Gemini 3.7 Flash 是 Google 的多模态模型,适用于快速智能体工作流、编程和复杂的多步推理。它专为……而设计