基础模型
提供语言、推理、视觉或代码能力的“引擎”。同一模型可以被多个产品调用。
GLOBAL AI MODEL & AGENT FIELD GUIDE / 2026
从基础模型到执行型 Agent,用任务、约束与工作流做选择。拒绝跑分崇拜,也不把所有 AI 产品混为一谈。
模型提供能力
Agent 完成过程
提供语言、推理、视觉或代码能力的“引擎”。同一模型可以被多个产品调用。
围绕模型构建的聊天、搜索、办公或开发界面,加入数据、权限和协作体验。
能规划步骤、调用工具、操作环境并根据结果继续执行的工作流系统。
01 / FOUNDATION MODELS
按家族而非瞬时版本比较。点击卡片查看优势、限制、典型场景与官网。
没有匹配的模型家族。
02 / TASK MATRIX
这些是选型起点,不是绝对排名。真实效果还取决于具体版本、提示、工具和数据。
| 任务 | 首要能力 | 优先观察 | 常见陷阱 |
|---|---|---|---|
| 复杂研究 | 推理 + 检索 | 引用可追溯、长任务稳定性 | 把流畅表述当成事实 |
| 软件开发 | 代码 + 工具调用 | 仓库理解、测试闭环、权限控制 | 只看单次代码生成 |
| 中文内容 | 语言 + 本地知识 | 语气、术语、合规与长文一致性 | 忽视具体行业语料 |
| 图像与视频理解 | 多模态 | 细节识别、空间关系、输出格式 | 用简单 OCR 代替理解测试 |
| 批量自动化 | 成本 + 可靠性 | 结构化输出、延迟、失败重试 | 直接用最贵旗舰模型 |
| 私有化部署 | 开放权重 | 许可证、硬件、运维和微调生态 | 只比较参数规模 |
03 / AGENT LANDSCAPE
选择 Agent 时,关键不是它“会不会回答”,而是它能访问什么、能执行什么、出了问题如何停止与追踪。
04 / REAL WORKFLOWS
推荐组合 强代码模型 + 仓库型 Agent + 浏览器测试
推荐组合 联网研究 Agent + 长上下文模型 + 引用管理
推荐组合 工作流平台 + 分层模型 + 审批与日志
推荐组合 开放权重模型 + RAG + 权限与评测
05 / DECISION FRAMEWORK
输入是什么、输出是什么、成功如何衡量?
隐私、地区、预算、速度和部署要求。
用自己的 20–100 个案例,而不是只看榜单。
超时、幻觉、工具失败和权限越界如何处理?
简单任务用小模型,困难任务升级到强模型或人工。
让模型负责生成与判断,
让系统负责约束与验证。
06 / SOURCES
页面按模型家族与产品定位整理,不记录容易快速失效的价格、上下文数字和跑分名次。具体版本、地区可用性、许可证与计费请始终查看厂商官方页面。