收录 智谱 GLM-5.3/GLM-4.7、Claude Opus 5、GPT-5.6、DeepSeek-V4、Gemini 3.7、Qwen 3.8、Grok 4.6。将「模型能力评测」与「渠道价格」彻底解耦,清晰呈现模型真实水准与各渠道成本差异。
评估模型在前端页面设计、HTML/CSS/JS 全栈代码生成、组件重构与交互响应等综合 Web 开发任务中的真实人类偏好。
视觉多模态核心测试:将 Figma/截图等设计稿直接端到端转化为像素级还原、高保真响应式 Web 前端代码。
测试模型在复杂工程环境下的多步自主规划、Tool Use/API 调用、环境反馈修正与复杂任务闭环能力。
测试长文档、复杂排版 PDF、研报财报结构化提取、多模态图表理解与长上下文精准召回。
单一数据源来自 Arena.ai。严格提取 WebDev、图生网页、Agent、文档理解 4 个核心维度前 10 名模型的并集展示。
前端/全栈 Web 开发能力真人对战评分 (Top 7)
设计稿/截图高保真转化为前端代码能力 (Top 7)
| 模型名称 ↕ | 出品厂商 ↕ | 🌐 WebDev Elo ↕ | 🖼️ 图生网页 Elo ↕ | 🤖 Agent Elo ↕ | 📄 文档 Elo ↕ | 核心能力优势与业务定位 |
|---|