三大核心维度严格拆解:模型原生能力 × 官方原厂定价 × 非官方中转比价

大模型多维评测体系与全渠道 Token 成本对比

收录 智谱 GLM-5.3/GLM-4.7、Claude Opus 5、GPT-5.6、DeepSeek-V4、Gemini 3.7、Qwen 3.8、Grok 4.6。将「模型能力评测」「渠道价格」彻底解耦,清晰呈现模型真实水准与各渠道成本差异。

📚 单一权威数据来源: 能力评测全量采用 LMSYS / Arena.ai 真人匿名盲测 Elo 权威数据
✅ 数据审核: 2026-08-21 (Arena.ai 单一源)
🌐 WebDev 网页开发
前端与全栈

评估模型在前端页面设计、HTML/CSS/JS 全栈代码生成、组件重构与交互响应等综合 Web 开发任务中的真实人类偏好。

🎯 适用场景: 独立全栈建站、前端组件开发、页面交互与 UI 布局。
🖼️ 图生网页 (Image-to-Web)
视觉高还原代码

视觉多模态核心测试:将 Figma/截图等设计稿直接端到端转化为像素级还原、高保真响应式 Web 前端代码。

🎯 适用场景: UI 设计稿直出网页、截图复刻、视觉反向工程与组件拆解。
🤖 Agent 智能体
工具调用与规划

测试模型在复杂工程环境下的多步自主规划、Tool Use/API 调用、环境反馈修正与复杂任务闭环能力。

🎯 适用场景: Cursor/Cline 编程助手、自动化运维、多步骤 Agent 工作流。
📄 Document 文档理解
复杂文档解析

测试长文档、复杂排版 PDF、研报财报结构化提取、多模态图表理解与长上下文精准召回。

🎯 适用场景: 企业知识库 RAG、财报合同核查、复杂 PDF 提取与问答。

🏆 维度一:Arena.ai 权威能力评测天梯 (单一数据源) 15 款前沿主流模型

单一数据源来自 Arena.ai。严格提取 WebDev、图生网页、Agent、文档理解 4 个核心维度前 10 名模型的并集展示。

🌐 Arena.ai WebDev 网页开发 Elo 盲测天梯

前端/全栈 Web 开发能力真人对战评分 (Top 7)

🖼️ Arena.ai 图生网页 (Image-to-Web) Elo 天梯

设计稿/截图高保真转化为前端代码能力 (Top 7)

🔍
模型名称 ↕ 出品厂商 ↕ 🌐 WebDev Elo ↕ 🖼️ 图生网页 Elo ↕ 🤖 Agent Elo ↕ 📄 文档 Elo ↕ 核心能力优势与业务定位