SIGNAL ONLINE AI CODING // 2026 VIEW

AI CODING

METHODS · WORKFLOW · TOOLS · FUTURE // 人机协作的编程范式

> 五年时间,编程的"单位"从一行代码变成一个任务,又正在变成一份规格:2021 年 Copilot 在光标后猜你的下一个词;2025 年 Claude Code 读懂你的整个仓库、自己跑测试、自己修 bug;2026 年的实验方向是规格驱动——人只维护"要什么",机器负责"怎么做"。这一页是 2026 年秋天的一次快照:五种范式、七步流程、六年工具史、四条前景——以及不随范式改变的那部分:理解、验证与责任,始终在人这边。

SCOPE: 方法 / 流程 / 工具 / 前景 FILE: ai.html TIMELINE: 2021 – 2026 BUILD v1.0

Methods — 五层范式与六个方法

范式演进 // 补全 → 对话 → Agent → 多 Agent → 规格驱动
L1 // 2021

行级补全

GitHub Copilot

光标后猜下一个 token,人写主干、机器补枝叶。

单位:一行
L2 // 2022–23

对话生成

ChatGPT · Cursor Chat

描述需求得代码块,人负责粘贴、接线、调试。

单位:一个函数
L3 // 2024–25

Agent 编码

Claude Code · Codex CLI

给任务不给步骤:读库、改码、跑测试、迭代修复。

单位:一个任务
L4 // 2025–26

多 Agent 协作

编排 · 子代理

主 Agent 分解项目,子 Agent 并行执行,人审合并。

单位:一个特性
L5 // 实验中

规格驱动

Spec-Driven

规格即契约,代码是可再生的推导物,验证回归规格。

单位:一份规格

提示工程Prompt Engineering

zero/few-shot 示例、思维链(CoT,Wei et al. 2022)、角色与约束设定——L2 时代的核心技能,L3 后沉淀为"给 agent 写任务说明"的能力。

检索增强RAG

外部知识注入(Lewis et al. 2020):文档/代码库向量化检索后进上下文——企业落地最常用的"接地"手段,代码场景演化为 repo map 与语义索引。

上下文工程Context Engineering

CLAUDE.md / AGENTS.md 项目规约、MCP 工具协议、精准检索代替塞满窗口——L3 之后真正的胜负手:模型能力相近时,谁喂的上下文质量高谁赢。

Agentic 循环Agentic Loop

感知(读库/跑命令)→ 规划(拆步骤)→ 行动(改文件)→ 反思(看测试结果)→ 循环直到验收——现代 agent 的心跳,工具调用是它的手。

测试先行TDD with AI

人写测试(定义"对"),AI 跑红绿灯循环直到全绿——把审查从"读代码"降维成"读测试结果",是对抗 AI 代码"看着对"的最经济手段。

规格驱动Spec-Driven Dev

先冻结规格(验收标准、接口契约、不变量),再让 agent 生成实现;规格可执行/可验证时(BDD、形式化),代码获得"可再生"地位——L5 的雏形。

范式不是替代是叠加:2026 年的真实工作里,补全(写一行)、对话(问一个 API)、Agent(做一个任务)天天同框使用——选层依据是任务粒度与验证成本,不是越高级越好;用 L3 做 L1 的活(让 agent 补一行代码)与用 L1 做 L3 的活(手搓整个特性)同样低效。

Workflow — 七步流程与 Agentic 循环

AI CODING 工作流 // 需求 → 迭代,人机分工随范式滑动

七步主流程:需求澄清(人:要解决什么)→ ② 规约固化(spec / CLAUDE.md / 验收标准——AI 时代最重要的文档)→ ③ 计划(plan mode:agent 出方案、人砍需求)→ ④ 实现(agent 并行改码,人不再逐行陪同)→ ⑤ 审查(人审 PR + 机器审:lint/安全扫描/AI reviewer)→ ⑥ 验证(测试、静态分析,高保障领域走向形式化)→ ⑦ 迭代与沉淀(把这次学到的约定写回规约——上下文的复利)。

不变的两个原则:验证左移——规约阶段的一个歧义,比实现阶段的十个 bug 便宜;② 上下文复利——项目规约文件每迭代一次就更准一分,它是团队 AI 能力的真正资产(模型人人能买,上下文买不到)。

职责的分界线从未移动:无论 L1 还是 L5,"理解需求、定义正确、为合并负责"始终是人。范式升级改变的是人审的对象:从逐行代码 → PR 级 diff → 测试结果 → 规格。审查粒度越粗,对规约质量的要求越苛刻。

Simulate — 范式分工实验室 × 六年时间线沙盘

双视角实验室 // 切范式看七步流程的人机分工;拖年份看里程碑与 SWE-bench 进度
视角 A:五种范式在"需求→迭代"七步里各自的分工形态;视角 B:2021–2026 每年的标志性工具与 SWE-bench Verified 分数爬升
人主导 AI 主导 人机共审

Tools — 六年工具史(2021–2026)

代表性工具与能力里程碑
年份里程碑含义
2021GitHub Copilot 技术预览(2022.6 GA)L1 补全进入主流 IDE,"AI 结对"第一次可用
2022ChatGPT(11 月)对话式编程普及,prompt 成为全民技能
2023GPT-4;Cursor;Aider;SWE-bench 提出L2 成熟;真实 issue 数据集建立度量衡(GPT-4 当时 pass@1 约 2%)
2024Devin(3 月);Claude 3.5 Sonnet;Composer 多文件编辑;MCP 开源(11 月)"自主软件工程师"叙事登场;工具协议统一 agent 生态
2025Claude Code GA;OpenAI Codex CLI;Gemini CLI;Agent SDK 层出不穷L3 Agent 编码主流化,终端成为主战场;SWE-bench Verified 头部 70%+
2026多 Agent 编排成熟;规格驱动实验;形式化验证结合L4 落地、L5 探索;榜单逼近饱和,竞赛转向长任务与真实仓库

工具版图(按形态):CLI/终端 Agent——Claude Code、OpenAI Codex CLI、Gemini CLI、Aider(开源);② IDE 集成——Cursor、GitHub Copilot、Windsurf、JetBrains AI;③ 云端自主平台——Devin、Jules 类异步交付;④ 协议与生态——MCP(工具接入)、LSP(语义理解)、各家 Agent SDK;⑤ 国内——通义灵码、文心快码 Comate、CodeGeeX 等。选型三问:上下文怎么进(repo 理解深度)、验证怎么出(测试/命令闭环)、数据去哪了(合规边界)。

Future — 四条前景与不变量

度量走向饱和,战场转向长任务

SWE-bench Verified 从 2023 年个位数爬到 2025 年 70%+、2026 年头部 75–80%(公开报告值,口径有异)——单 issue 修复不再是分水岭;新的竞赛在多日长任务、跨仓重构、真实工程约束(遗留代码/评审流程)。

形式化验证的文艺复兴

AI 生成快、验证慢的矛盾,正把 Coq/Lean/TLA+ 从庙堂推向工具链:四色定理 2005 年的 Coq 路线(机器生成 + 机器验证)正在变成 AI Coding 的标准架构——生成可以外包,验证必须收口

多 Agent 与组织级编排

主 Agent 规划 + 子 Agent 并行 + 专用 reviewer Agent 的分工形态,正在把"团队协作协议"翻译成"机器协作协议";编排能力(谁干什么、怎么合并、冲突谁裁)成为新中间件。

工程师角色的上移

打字速度归零价值,规约能力(说清"要什么")、验证能力(判断"对不对")、品味(决定"值不值得")升值——初级岗位形态重定义,"读代码 + 审规格"取代"写代码"成为日常;技能断层与 AI 代码债是真实的组织风险。

三个不变量:① 责任不外包——合并按钮后面必须有一个理解变更的人;② 上下文是资产——模型可换,项目规约与验证体系跟着团队走;③ 安全边界后置即风险——prompt injection、供应链、密钥泄露在 agent 拿到执行权的今天从理论变成工单。