英语能力诊断基线:基于 Life Level-up Guide 的 English Diagnostic 模板落地四技能基线、0–2 评分与 30/90 天复测工作流
导读:本文以仓库中的 English Diagnostic Template 为骨架,系统拆解「一份诊断记录表」如何承接 CEFR 自评、四技能任务、证据卡映射、0–2 评分与 Day-30 / Week-12 复测,并落地为可被复盘的证据链。读完你能够直接复刻一份可用于听、读、说、写四项技能的英语诊断记录,掌握「记录评分理由而非只记分数」「保留未经修饰的原始样本」「把下一个变量写进 90 天循环」的关键方法,并理解该模板在仓库自动化内容检查中的定位。
一、先理解模板的位置:它不是一份孤立问卷
在打开模板之前,值得先弄清它在 docs/en 这套「人生进阶 / 终身学习」内容体系里承担什么角色。
从 English Home(英文版主页) 的结构可以看出,英语是整本指南的「地基」。主页的 Foundation 部分明确写道:英语能力「不是由单词收藏量证明的,而是由你在真实场景中能理解、表达并完成什么来证明」。正是在这条准则下,主页把 English Diagnostic 与 Vocabulary Audit、Listening Resource Audit、Speaking/Writing/Reading Evidence Card、Artifact Brief 一起列为「可以直接开始」的入口工具。
而模板文档正文第一句给出了它的前置条件:
Read CEFR Goals and Self-check, then complete all four tasks under the same topic, similar time, and explicit restrictions.
对应的中文版页面路径为 CEFR Goals and English Self-check。也就是说,先做 CEFR 分级自评,再用诊断模板采集四技能基线,两者构成一对「定位 → 采样」的组合,模板负责把你的 A1–C2 方向感转成一份可复测、可比较的原始证据。模板定位为「诊断当前基线、把任务完成度与表达可懂度、准确性/广度、组织/流利度、修订/迁移分开衡量」,详细见模板文件的 description 元信息。
模板所属位置是 docs/en/templates,与其并列的证据卡、审计卡与循环表共同构成一套相互咬合的体系,后文会逐项串起来。
二、模板全文逐字段拆解(可直接复制使用)
下面先把 english-diagnostic.md 中的完整记录模板原样给出(在实际使用中,建议把这份内容复制进私人笔记,为每一次诊断单独建一份副本):
# English Diagnostic — YYYY-MM-DD
Real use context:
Topic and source:
Restrictions (time, captions, dictionary, AI):
Day-30 retest date:
Week-12 retest date:
| Skill | Conditions | First sample | Delayed/parallel sample | Evidence card |
| --- | --- | --- | --- | --- |
| Listening | | | | Listening Resource Audit |
| Reading | | | | Reading Evidence Card |
| Speaking | | | | Speaking Evidence Card |
| Writing | | | | Writing Evidence Card |
| Skill | Task 0–2 | Comprehensibility 0–2 | Accuracy/range 0–2 | Organisation/fluency 0–2 | Revision/transfer 0–2 |
| --- | ---: | ---: | ---: | ---: | ---: |
| Listening | | | | | |
| Reading | | | | | |
| Speaking | | | | | |
| Writing | | | | | |
Strongest evidence:
Weakest evidence:
Repeated errors:
Provisional CEFR by skill:
12-week real task:
Smallest next exercise:
Parts requiring a professional or primary-source check:
One variable to change next cycle:
模板可以被分为五个层次来读。
2.1 元信息头:先锚定使用场景与复测时间点
Real use context:这次英语使用发生在什么真实场景(如「给海外客户写周报」「参加英文技术会议」),它是后续所有任务选题的依据;Topic and source:四技能任务共用的话题与素材来源,保证听、读、说、写在同一话题语境下互相支撑;Restrictions (time, captions, dictionary, AI):记录限时、是否允许字幕、是否允许查词典、是否允许 AI 协助。限制条件写得越明确,Day-30 / Week-12 复测时的对照越可信;Day-30 retest date与Week-12 retest date:先给自己约定两个复测日,让诊断天然挂入 30 天与 12 周两个时间刻度。
2.2 技能条件表:记录「在什么条件下做」
第一张表按听、读、说、写四技能分别填写 Conditions、First sample(首次原始样本存放位置)与 Delayed/parallel sample(延迟/平行样本)。右边一列指向更细粒度的记录工具:
| 技能 | 对应证据卡 | 存放位置 |
|---|---|---|
| Listening | Listening Resource Audit | docs/en/templates/listening-audit.md |
| Reading | Reading Evidence Card | docs/en/templates/reading-evidence.md |
| Speaking | Speaking Evidence Card | docs/en/templates/speaking-evidence.md |
| Writing | Writing Evidence Card | docs/en/templates/writing-evidence.md |
正如模板开头提示的:当需要更精细的诊断时,使用对应的 skill card(技能卡)。诊断表只记录总分与关键结论,细分到「逐段标注错误、逐遍记录修改」的工作交给上述四张卡完成。
2.3 五维 0–2 评分表:诊断表的核心输出
第二张表要求对四个技能分别从五个维度打分,形成 5×4 的网格:
Task 0–2:任务完成度——想传达的信息与目的有没有到达;Comprehensibility 0–2:可懂度——受众是否不需要猜测就能听懂/读懂;Accuracy/range 0–2:准确性与语言资源广度——语言选择是否支撑任务;Organisation/fluency 0–2:组织与流利度——信息是否连贯、是否被破坏性停顿打断;Revision/transfer 0–2:修订与迁移——能否依据反馈改进,并在新任务里复用。
这与 CEFR Self-check 页面「Feedback Rubric」一节列出的五条评分维度一一对应,说明诊断表不是自创口径,而是对 CEFR 自评量规的承接。模板建议对四项技能分开评分(the four skills differ 时 profile 往往不均衡),避免用一个「平均等级」抹平短板。
2.4 结论区:从分数走向下一步动作
Strongest evidence / Weakest evidence:回答「哪份样本最能证明能力、哪份暴露了最大缺口」;Repeated errors:按错误类别归并复现的错误,而不是记录单次失误;Provisional CEFR by skill:给每个技能一个「暂定」CEFR 等级——注意模板用词是 Provisional,与 CEFR 自评页「不要让一次任务给自己贴上『达到了某个级别』的标签」的立场一致;12-week real task:把 12 周后要完成的真实任务写下来,见 90-Day Action Plan 的长期规划语境;Smallest next exercise:挑一个最小可执行的下一次练习,遵循「任务缩小而不是硬扛难度」的原则;Parts requiring a professional or primary-source check:明确哪些部分(如涉及健康、法律、金融、专业术语的文本)需要回到可靠的一手来源或专业人士;One variable to change next cycle:每一轮只改一个变量,保证前后结果可比。
2.5 评分参照与记录纪律
模板在代码块外补了一条硬性评分参照:
Scoring reference:
0=not completed,1=partial or cue-dependent,2=stable under the stated conditions. Record the reason for each score, not only the number.
0:未完成;1:部分完成,或需要提示/依赖线索(cue-dependent);2:在既定的条件下表现稳定。
「为每个分数记录理由,而不只是写个数字」是整份模板最容易被跳过的纪律。分数若不附带样本与理由,就退化成自我感觉;附带理由后,Day-30 复测才能精确回答「哪一项真的变了」。
三、四技能任务如何设计:同一主题 + 相似时长 + 明确限制
诊断模板规定四任务应满足三个对齐条件:同一主题(same topic)、相似时长(similar time)、明确的限制条件(explicit restrictions)。这样做是为了让「技能差异」成为唯一被测量对象——如果听力和阅读的话题难度相差悬殊,分数差异就解释不了。
每个任务的标准规格可以在 CEFR Self-check 页面的「Four-skill Evidence」表格里找到:
| 技能 | 10–20 分钟任务规格 | 检查要点 |
|---|---|---|
| Listening | 听 2–4 分钟,记录主旨、三个细节并做复述 | 主旨、细节、语块边界、miss 的原因 |
| Reading | 读 600–1000 词,写五句概括加一个质疑 | 主张、证据、推断、生词是否阻断理解 |
| Speaking | 录一段 2 分钟不准备的口头解释 | 可懂度、停顿、语法、语块、任务完成度 |
| Writing | 20 分钟写 180–250 词的邮件/解释/论证 | 目的、结构、支撑、准确性、修订 |
写作时还需遵守一条「无脚手架」红线:不要查语言资料,也不要让 AI 重写第一版(Do not look up language or ask AI to rewrite the first version)。第一版必须是你独立完成的样子,因为它要充当未来所有复测的对照样本。这一思想在证据体系中反复出现,例如 Evidence Chain Template 第二节要求「基线在任何 AI、同伴反馈或密集训练之前采集」,并显式记录当时使用的工具。
四、为什么必须保留「原始样本 + 辅助版本 + 延迟表现」三件套
模板结尾给出了整个诊断闭环的收口要求:
Repeat under the same conditions or a close parallel task on day 30 and week 12. Keep the raw sample, assisted version, delayed performance, and scoring reasons instead of comparing only polished products.
翻译成操作语言就是:不要拿「润色后的成品」相互比较,而要并排保留四样东西:
- Raw sample(原始样本):第一次无辅助产出的录音/文稿,是能力下限的真实证据;
- Assisted version(辅助版本):查了词典、听了反馈或经 AI 协助后的版本,用于看清「脚手架拆掉之前能走多远」;
- Delayed performance(延迟表现):过一段时间、去掉提示后独立完成的表现,用于验证是不是「离开熟悉脚本就消失」;
- Scoring reasons(评分理由):每个 0–2 分数背后的具体依据。
这一设计与 Evidence Chain Template 的「基线 → 即时表现 → 延迟保持 → 迁移」四段结构同构,也与 CEFR Self-check「Carry the Self-check into the Next Cycle」一节给出的四步(保存原始基线、记录即时表现与所获帮助、七天后移除近期提示重测延迟保持、30/90 天后更换话题验证迁移)完全对齐。
关于复测条件,模板给了两种选择:相同条件(same conditions) 复测,用来比较能力绝对变化;或 接近的平行任务(close parallel task),用来测试迁移。典型节奏可参考 Listening Resource Audit 里的七天循环:Day 1 无字幕听写主旨与细节 → Day 2 对照文本修补关键片段 → Day 3 影子跟读语块 → Day 5 更换一个条件 → Day 7 用平行素材做迁移测试。口说与写作的证据卡 Speaking Evidence Card、Writing Evidence Card 也都内置了 Day 1 / Days 3–7 / Day 30 的延迟迁移测试表,可作为 Day-30 与 Week-12 两个复测点的中间刻度。
五、把「下一个变量」写进 90 天循环,完成系统交接
诊断模板的最后一行字段 One variable to change next cycle 不是问卷收尾,而是一个交接协议。模板文档明确要求:把这一个变量写进 90-Day Cycle Map(Put the next variable into the 90-Day Cycle Map)。
打开 90-Day Cycle Map 可以看到它与诊断模板的接口点:
- 第一节 Cycle commitment 要求写下第 90 天要交付的真实成果与完成标准,承接诊断表里的
12-week real task; - 第二节 Day-one baseline 要求保留一份「没有让 AI 代做任务」的样本——录音、短文、阅读重建、代码或演示均可,正是诊断模板 First sample 的去处;
- 第三节三个阶段的闸门(gates):Calibrate(1–14 天,回答「到底在练什么、瓶颈是什么」)、Stack(15–56 天,回答「哪个动作在什么条件下稳定下来」)、Ship(57–90 天,回答「换个听众/话题/用户是否依然可用」)。闸门没有证据就不自动加难度,应先把任务缩小或补齐前置;
- 第五节 Evidence chain 明确提醒:聊天记录、播放时长、打卡截图只是「过程痕迹」(process traces),关键判断必须回到实物、录音、读者/用户反馈以及新条件下的表现。
因此完整闭环是:CEFR 定位 → English Diagnostic 采四技能基线 → 分技能证据卡做精细跟踪 → 每周复盘 → Day-30 / Week-12 同条件或平行复测 → 把唯一变量写回 90 天循环图。模板之间通过 Evidence Chain Template、Weekly Review、Learning State 完成跨会话交接,避免只留一个孤零零的最终分数。
六、仓库如何保证这类模板可被稳定检索与引用
值得说明的是,english-diagnostic.md 这类模板页在本仓库并不是随手写的 markdown,而是被自动化脚本与测试持续校验的内容单元。理解这套校验,能帮你判断模板引用的可靠性,也能解释为什么前文所有链接都指向稳定路径。
6.1 内容检查脚本的约束
scripts/check-content.mjs 是全仓库的内容守门人,它对本文件施加了几类约束(对应实现):
- Frontmatter 必备字段:每个公开页面必须包含
title、description、updated三键,且updated必须是YYYY-MM-DD且不晚于当前日期、description不得过短(少于 24 字符会报错)。这也解释了模板文件顶部为什么有标准化的 frontmatter; - 链接目标必须存在:脚本会解析所有 Markdown 链接与 HTML href,检查解析后的本地文件是否真实存在(对应实现),因此文中「相对链接必须指向实际文件」不是建议而是仓库硬性规则;
- 中英双语与标题层级对齐:英文页面必须在
docs/en下有中文对应页,反之亦然,且两页的标题层级结构必须一致(checkBilingualParity 与 checkHeadingParity); - 过期字符串与隐私红线:脚本内置了一组
STALE_PATTERNS(残留旧站点域名、公开 QQ 号、失效网盘链接等),一旦命中即报错(对应实现),从机制上防止模板引用过期的外部资源。
6.2 Playwright 端到端测试的兜底
tests/site.spec.mjs 则从「页面能否真实渲染」层面兜底:它遍历导航中每个 source,逐一断言对应路由的 H1 可见且 main 区域可见(对应实现),并校验页面 meta[name="description"]、canonical、og:url 等元数据是否跟随路由。针对模板体系,测试还显式断言了英文版 Evidence Chain Template 页面包含「Save an Unaided Baseline」与「Test Delayed Retention」两个关键小节标题(对应实现),以及 Weekly Review 页面存在指向 Evidence Chain 与 Rhythm Ledger 的交接链接(对应实现)。换句话说,你阅读到的这些模板不是静态孤页,而是被测试持续守护、可被搜索引擎与 Agent 稳定锚定的内容节点。
七、落地步骤清单:从零完成一次标准诊断
把以上拆解收拢成可直接照做的操作序列:
- 先做 CEFR 自评:通读 CEFR Goals and English Self-check,完成其中四技能基线任务规格,判断自己处于哪个暂定区间;
- 选定真实话题与素材:在
Real use context里写下一个真实使用场景,并让听、读、说、写四任务围绕同一话题展开; - 写下限制条件与复测日期:明确限时、字幕、词典、AI 的使用边界,并填好
Day-30 retest date与Week-12 retest date; - 四技能各做一次无辅助任务:产出 First sample,存放到明确路径;需要更细诊断时,分别落到 Listening Resource Audit、Reading Evidence Card、Speaking Evidence Card、Writing Evidence Card;
- 按五维打 0–2 分并写理由:对每项技能完成五列评分,且在结论区写下
Strongest/Weakest evidence、Repeated errors与Provisional CEFR by skill; - 安排最小下一步:填
Smallest next exercise,识别需要专业/一手来源核查的部分,确定One variable to change next cycle; - 把变量交还给循环:打开 90-Day Cycle Map,将该变量写入下轮计划的对应位置;
- Day-30 与 Week-12 复测:在相同条件或接近平行任务下重做,并排保存原始样本、辅助版本、延迟表现与评分理由,而不是只比较润色后的成品。
这套流程的价值不在于给语言水平贴一个漂亮标签,而在于为下一次练习提供一个可比较的锚点——正如模板与配套的 CEFR 页面反复强调的:能力不是由自我感觉证明的,而是由你能够理解、表达并完成的东西,以及这些表现在时间和条件变化之后是否仍然成立来证明的。若希望把同一套「基线—证据—延迟—迁移」的方法延伸到英语之外(AI 学习、项目交付、生活实践),可继续阅读 Evidence: How Change Becomes Visible 与 Learning State Template。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0629
MiniCPM5-2BMiniCPM5-2B 是一款面向端侧、本地部署和资源受限场景的 2B 稠密 Transformer,能够达到同尺寸开源模型 SOTA 水平。Markdown00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
HivisionIDPhotos⚡️HivisionIDPhotos: a lightweight and efficient AI ID photos tools. 一个轻量级的AI证件照制作算法。Python07
DragonOSDragonOS is an operating system developed from scratch using Rust, with Linux compatibility. It is designed for **Serverless** scenarios. 使用Rust从0自研内核,具有Linux兼容性的操作系统,面向云计算Serverless场景而设计。Rust00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00