AI CODING
METHODS · WORKFLOW · TOOLS · FUTURE // 人机协作的编程范式
> 五年时间,编程的"单位"从一行代码变成一个任务,又正在变成一份规格:2021 年 Copilot 在光标后猜你的下一个词;2025 年 Claude Code 读懂你的整个仓库、自己跑测试、自己修 bug;2026 年的实验方向是规格驱动——人只维护"要什么",机器负责"怎么做"。这一页是 2026 年秋天的一次快照:五种范式、七步流程、六年工具史、四条前景——以及不随范式改变的那部分:理解、验证与责任,始终在人这边。
Methods — 五层范式与六个方法
行级补全
光标后猜下一个 token,人写主干、机器补枝叶。
单位:一行对话生成
描述需求得代码块,人负责粘贴、接线、调试。
单位:一个函数Agent 编码
给任务不给步骤:读库、改码、跑测试、迭代修复。
单位:一个任务多 Agent 协作
主 Agent 分解项目,子 Agent 并行执行,人审合并。
单位:一个特性规格驱动
规格即契约,代码是可再生的推导物,验证回归规格。
单位:一份规格提示工程Prompt Engineering
zero/few-shot 示例、思维链(CoT,Wei et al. 2022)、角色与约束设定——L2 时代的核心技能,L3 后沉淀为"给 agent 写任务说明"的能力。
检索增强RAG
外部知识注入(Lewis et al. 2020):文档/代码库向量化检索后进上下文——企业落地最常用的"接地"手段,代码场景演化为 repo map 与语义索引。
上下文工程Context Engineering
CLAUDE.md / AGENTS.md 项目规约、MCP 工具协议、精准检索代替塞满窗口——L3 之后真正的胜负手:模型能力相近时,谁喂的上下文质量高谁赢。
Agentic 循环Agentic Loop
感知(读库/跑命令)→ 规划(拆步骤)→ 行动(改文件)→ 反思(看测试结果)→ 循环直到验收——现代 agent 的心跳,工具调用是它的手。
测试先行TDD with AI
人写测试(定义"对"),AI 跑红绿灯循环直到全绿——把审查从"读代码"降维成"读测试结果",是对抗 AI 代码"看着对"的最经济手段。
规格驱动Spec-Driven Dev
先冻结规格(验收标准、接口契约、不变量),再让 agent 生成实现;规格可执行/可验证时(BDD、形式化),代码获得"可再生"地位——L5 的雏形。
Workflow — 七步流程与 Agentic 循环
七步主流程:① 需求澄清(人:要解决什么)→ ② 规约固化(spec / CLAUDE.md / 验收标准——AI 时代最重要的文档)→ ③ 计划(plan mode:agent 出方案、人砍需求)→ ④ 实现(agent 并行改码,人不再逐行陪同)→ ⑤ 审查(人审 PR + 机器审:lint/安全扫描/AI reviewer)→ ⑥ 验证(测试、静态分析,高保障领域走向形式化)→ ⑦ 迭代与沉淀(把这次学到的约定写回规约——上下文的复利)。
不变的两个原则:① 验证左移——规约阶段的一个歧义,比实现阶段的十个 bug 便宜;② 上下文复利——项目规约文件每迭代一次就更准一分,它是团队 AI 能力的真正资产(模型人人能买,上下文买不到)。
Simulate — 范式分工实验室 × 六年时间线沙盘
Tools — 六年工具史(2021–2026)
| 年份 | 里程碑 | 含义 |
|---|---|---|
| 2021 | GitHub Copilot 技术预览(2022.6 GA) | L1 补全进入主流 IDE,"AI 结对"第一次可用 |
| 2022 | ChatGPT(11 月) | 对话式编程普及,prompt 成为全民技能 |
| 2023 | GPT-4;Cursor;Aider;SWE-bench 提出 | L2 成熟;真实 issue 数据集建立度量衡(GPT-4 当时 pass@1 约 2%) |
| 2024 | Devin(3 月);Claude 3.5 Sonnet;Composer 多文件编辑;MCP 开源(11 月) | "自主软件工程师"叙事登场;工具协议统一 agent 生态 |
| 2025 | Claude Code GA;OpenAI Codex CLI;Gemini CLI;Agent SDK 层出不穷 | L3 Agent 编码主流化,终端成为主战场;SWE-bench Verified 头部 70%+ |
| 2026 | 多 Agent 编排成熟;规格驱动实验;形式化验证结合 | L4 落地、L5 探索;榜单逼近饱和,竞赛转向长任务与真实仓库 |
工具版图(按形态):① CLI/终端 Agent——Claude Code、OpenAI Codex CLI、Gemini CLI、Aider(开源);② IDE 集成——Cursor、GitHub Copilot、Windsurf、JetBrains AI;③ 云端自主平台——Devin、Jules 类异步交付;④ 协议与生态——MCP(工具接入)、LSP(语义理解)、各家 Agent SDK;⑤ 国内——通义灵码、文心快码 Comate、CodeGeeX 等。选型三问:上下文怎么进(repo 理解深度)、验证怎么出(测试/命令闭环)、数据去哪了(合规边界)。
Future — 四条前景与不变量
度量走向饱和,战场转向长任务
SWE-bench Verified 从 2023 年个位数爬到 2025 年 70%+、2026 年头部 75–80%(公开报告值,口径有异)——单 issue 修复不再是分水岭;新的竞赛在多日长任务、跨仓重构、真实工程约束(遗留代码/评审流程)。
形式化验证的文艺复兴
AI 生成快、验证慢的矛盾,正把 Coq/Lean/TLA+ 从庙堂推向工具链:四色定理 2005 年的 Coq 路线(机器生成 + 机器验证)正在变成 AI Coding 的标准架构——生成可以外包,验证必须收口。
多 Agent 与组织级编排
主 Agent 规划 + 子 Agent 并行 + 专用 reviewer Agent 的分工形态,正在把"团队协作协议"翻译成"机器协作协议";编排能力(谁干什么、怎么合并、冲突谁裁)成为新中间件。
工程师角色的上移
打字速度归零价值,规约能力(说清"要什么")、验证能力(判断"对不对")、品味(决定"值不值得")升值——初级岗位形态重定义,"读代码 + 审规格"取代"写代码"成为日常;技能断层与 AI 代码债是真实的组织风险。