首页
/ 英语能力诊断基线:基于 Life Level-up Guide 的 English Diagnostic 模板落地四技能基线、0–2 评分与 30/90 天复测工作流

英语能力诊断基线:基于 Life Level-up Guide 的 English Diagnostic 模板落地四技能基线、0–2 评分与 30/90 天复测工作流

2026-09-07 20:26:48作者:毕习沙Eudora

导读:本文以仓库中的 English Diagnostic Template 为骨架,系统拆解「一份诊断记录表」如何承接 CEFR 自评、四技能任务、证据卡映射、0–2 评分与 Day-30 / Week-12 复测,并落地为可被复盘的证据链。读完你能够直接复刻一份可用于听、读、说、写四项技能的英语诊断记录,掌握「记录评分理由而非只记分数」「保留未经修饰的原始样本」「把下一个变量写进 90 天循环」的关键方法,并理解该模板在仓库自动化内容检查中的定位。

一、先理解模板的位置:它不是一份孤立问卷

在打开模板之前,值得先弄清它在 docs/en 这套「人生进阶 / 终身学习」内容体系里承担什么角色。

English Home(英文版主页) 的结构可以看出,英语是整本指南的「地基」。主页的 Foundation 部分明确写道:英语能力「不是由单词收藏量证明的,而是由你在真实场景中能理解、表达并完成什么来证明」。正是在这条准则下,主页把 English Diagnostic 与 Vocabulary Audit、Listening Resource Audit、Speaking/Writing/Reading Evidence Card、Artifact Brief 一起列为「可以直接开始」的入口工具。

而模板文档正文第一句给出了它的前置条件:

Read CEFR Goals and Self-check, then complete all four tasks under the same topic, similar time, and explicit restrictions.

对应的中文版页面路径为 CEFR Goals and English Self-check。也就是说,先做 CEFR 分级自评,再用诊断模板采集四技能基线,两者构成一对「定位 → 采样」的组合,模板负责把你的 A1–C2 方向感转成一份可复测、可比较的原始证据。模板定位为「诊断当前基线、把任务完成度与表达可懂度、准确性/广度、组织/流利度、修订/迁移分开衡量」,详细见模板文件的 description 元信息。

模板所属位置是 docs/en/templates,与其并列的证据卡、审计卡与循环表共同构成一套相互咬合的体系,后文会逐项串起来。

二、模板全文逐字段拆解(可直接复制使用)

下面先把 english-diagnostic.md 中的完整记录模板原样给出(在实际使用中,建议把这份内容复制进私人笔记,为每一次诊断单独建一份副本):

# English Diagnostic — YYYY-MM-DD

Real use context:
Topic and source:
Restrictions (time, captions, dictionary, AI):
Day-30 retest date:
Week-12 retest date:

| Skill | Conditions | First sample | Delayed/parallel sample | Evidence card |
| --- | --- | --- | --- | --- |
| Listening | | | | Listening Resource Audit |
| Reading | | | | Reading Evidence Card |
| Speaking | | | | Speaking Evidence Card |
| Writing | | | | Writing Evidence Card |

| Skill | Task 0–2 | Comprehensibility 0–2 | Accuracy/range 0–2 | Organisation/fluency 0–2 | Revision/transfer 0–2 |
| --- | ---: | ---: | ---: | ---: | ---: |
| Listening | | | | | |
| Reading | | | | | |
| Speaking | | | | | |
| Writing | | | | | |

Strongest evidence:
Weakest evidence:
Repeated errors:
Provisional CEFR by skill:
12-week real task:
Smallest next exercise:
Parts requiring a professional or primary-source check:
One variable to change next cycle:

模板可以被分为五个层次来读。

2.1 元信息头:先锚定使用场景与复测时间点

  • Real use context:这次英语使用发生在什么真实场景(如「给海外客户写周报」「参加英文技术会议」),它是后续所有任务选题的依据;
  • Topic and source:四技能任务共用的话题与素材来源,保证听、读、说、写在同一话题语境下互相支撑;
  • Restrictions (time, captions, dictionary, AI):记录限时、是否允许字幕、是否允许查词典、是否允许 AI 协助。限制条件写得越明确,Day-30 / Week-12 复测时的对照越可信
  • Day-30 retest dateWeek-12 retest date:先给自己约定两个复测日,让诊断天然挂入 30 天与 12 周两个时间刻度。

2.2 技能条件表:记录「在什么条件下做」

第一张表按听、读、说、写四技能分别填写 ConditionsFirst sample(首次原始样本存放位置)与 Delayed/parallel sample(延迟/平行样本)。右边一列指向更细粒度的记录工具:

技能 对应证据卡 存放位置
Listening Listening Resource Audit docs/en/templates/listening-audit.md
Reading Reading Evidence Card docs/en/templates/reading-evidence.md
Speaking Speaking Evidence Card docs/en/templates/speaking-evidence.md
Writing Writing Evidence Card docs/en/templates/writing-evidence.md

正如模板开头提示的:当需要更精细的诊断时,使用对应的 skill card(技能卡)。诊断表只记录总分与关键结论,细分到「逐段标注错误、逐遍记录修改」的工作交给上述四张卡完成。

2.3 五维 0–2 评分表:诊断表的核心输出

第二张表要求对四个技能分别从五个维度打分,形成 5×4 的网格:

  • Task 0–2:任务完成度——想传达的信息与目的有没有到达;
  • Comprehensibility 0–2:可懂度——受众是否不需要猜测就能听懂/读懂;
  • Accuracy/range 0–2:准确性与语言资源广度——语言选择是否支撑任务;
  • Organisation/fluency 0–2:组织与流利度——信息是否连贯、是否被破坏性停顿打断;
  • Revision/transfer 0–2:修订与迁移——能否依据反馈改进,并在新任务里复用。

这与 CEFR Self-check 页面「Feedback Rubric」一节列出的五条评分维度一一对应,说明诊断表不是自创口径,而是对 CEFR 自评量规的承接。模板建议对四项技能分开评分(the four skills differ 时 profile 往往不均衡),避免用一个「平均等级」抹平短板。

2.4 结论区:从分数走向下一步动作

  • Strongest evidence / Weakest evidence:回答「哪份样本最能证明能力、哪份暴露了最大缺口」;
  • Repeated errors:按错误类别归并复现的错误,而不是记录单次失误;
  • Provisional CEFR by skill:给每个技能一个「暂定」CEFR 等级——注意模板用词是 Provisional,与 CEFR 自评页「不要让一次任务给自己贴上『达到了某个级别』的标签」的立场一致;
  • 12-week real task:把 12 周后要完成的真实任务写下来,见 90-Day Action Plan 的长期规划语境;
  • Smallest next exercise:挑一个最小可执行的下一次练习,遵循「任务缩小而不是硬扛难度」的原则;
  • Parts requiring a professional or primary-source check:明确哪些部分(如涉及健康、法律、金融、专业术语的文本)需要回到可靠的一手来源或专业人士;
  • One variable to change next cycle:每一轮只改一个变量,保证前后结果可比。

2.5 评分参照与记录纪律

模板在代码块外补了一条硬性评分参照:

Scoring reference: 0=not completed, 1=partial or cue-dependent, 2=stable under the stated conditions. Record the reason for each score, not only the number.

  • 0:未完成;
  • 1:部分完成,或需要提示/依赖线索(cue-dependent);
  • 2:在既定的条件下表现稳定。

「为每个分数记录理由,而不只是写个数字」是整份模板最容易被跳过的纪律。分数若不附带样本与理由,就退化成自我感觉;附带理由后,Day-30 复测才能精确回答「哪一项真的变了」。

三、四技能任务如何设计:同一主题 + 相似时长 + 明确限制

诊断模板规定四任务应满足三个对齐条件:同一主题(same topic)、相似时长(similar time)、明确的限制条件(explicit restrictions)。这样做是为了让「技能差异」成为唯一被测量对象——如果听力和阅读的话题难度相差悬殊,分数差异就解释不了。

每个任务的标准规格可以在 CEFR Self-check 页面的「Four-skill Evidence」表格里找到:

技能 10–20 分钟任务规格 检查要点
Listening 听 2–4 分钟,记录主旨、三个细节并做复述 主旨、细节、语块边界、miss 的原因
Reading 读 600–1000 词,写五句概括加一个质疑 主张、证据、推断、生词是否阻断理解
Speaking 录一段 2 分钟不准备的口头解释 可懂度、停顿、语法、语块、任务完成度
Writing 20 分钟写 180–250 词的邮件/解释/论证 目的、结构、支撑、准确性、修订

写作时还需遵守一条「无脚手架」红线:不要查语言资料,也不要让 AI 重写第一版(Do not look up language or ask AI to rewrite the first version)。第一版必须是你独立完成的样子,因为它要充当未来所有复测的对照样本。这一思想在证据体系中反复出现,例如 Evidence Chain Template 第二节要求「基线在任何 AI、同伴反馈或密集训练之前采集」,并显式记录当时使用的工具。

四、为什么必须保留「原始样本 + 辅助版本 + 延迟表现」三件套

模板结尾给出了整个诊断闭环的收口要求:

Repeat under the same conditions or a close parallel task on day 30 and week 12. Keep the raw sample, assisted version, delayed performance, and scoring reasons instead of comparing only polished products.

翻译成操作语言就是:不要拿「润色后的成品」相互比较,而要并排保留四样东西:

  1. Raw sample(原始样本):第一次无辅助产出的录音/文稿,是能力下限的真实证据;
  2. Assisted version(辅助版本):查了词典、听了反馈或经 AI 协助后的版本,用于看清「脚手架拆掉之前能走多远」;
  3. Delayed performance(延迟表现):过一段时间、去掉提示后独立完成的表现,用于验证是不是「离开熟悉脚本就消失」;
  4. Scoring reasons(评分理由):每个 0–2 分数背后的具体依据。

这一设计与 Evidence Chain Template 的「基线 → 即时表现 → 延迟保持 → 迁移」四段结构同构,也与 CEFR Self-check「Carry the Self-check into the Next Cycle」一节给出的四步(保存原始基线、记录即时表现与所获帮助、七天后移除近期提示重测延迟保持、30/90 天后更换话题验证迁移)完全对齐。

关于复测条件,模板给了两种选择:相同条件(same conditions) 复测,用来比较能力绝对变化;或 接近的平行任务(close parallel task),用来测试迁移。典型节奏可参考 Listening Resource Audit 里的七天循环:Day 1 无字幕听写主旨与细节 → Day 2 对照文本修补关键片段 → Day 3 影子跟读语块 → Day 5 更换一个条件 → Day 7 用平行素材做迁移测试。口说与写作的证据卡 Speaking Evidence CardWriting Evidence Card 也都内置了 Day 1 / Days 3–7 / Day 30 的延迟迁移测试表,可作为 Day-30 与 Week-12 两个复测点的中间刻度。

五、把「下一个变量」写进 90 天循环,完成系统交接

诊断模板的最后一行字段 One variable to change next cycle 不是问卷收尾,而是一个交接协议。模板文档明确要求:把这一个变量写进 90-Day Cycle Map(Put the next variable into the 90-Day Cycle Map)。

打开 90-Day Cycle Map 可以看到它与诊断模板的接口点:

  • 第一节 Cycle commitment 要求写下第 90 天要交付的真实成果与完成标准,承接诊断表里的 12-week real task
  • 第二节 Day-one baseline 要求保留一份「没有让 AI 代做任务」的样本——录音、短文、阅读重建、代码或演示均可,正是诊断模板 First sample 的去处;
  • 第三节三个阶段的闸门(gates):Calibrate(1–14 天,回答「到底在练什么、瓶颈是什么」)、Stack(15–56 天,回答「哪个动作在什么条件下稳定下来」)、Ship(57–90 天,回答「换个听众/话题/用户是否依然可用」)。闸门没有证据就不自动加难度,应先把任务缩小或补齐前置;
  • 第五节 Evidence chain 明确提醒:聊天记录、播放时长、打卡截图只是「过程痕迹」(process traces),关键判断必须回到实物、录音、读者/用户反馈以及新条件下的表现。

因此完整闭环是:CEFR 定位 → English Diagnostic 采四技能基线 → 分技能证据卡做精细跟踪 → 每周复盘 → Day-30 / Week-12 同条件或平行复测 → 把唯一变量写回 90 天循环图。模板之间通过 Evidence Chain TemplateWeekly ReviewLearning State 完成跨会话交接,避免只留一个孤零零的最终分数。

六、仓库如何保证这类模板可被稳定检索与引用

值得说明的是,english-diagnostic.md 这类模板页在本仓库并不是随手写的 markdown,而是被自动化脚本与测试持续校验的内容单元。理解这套校验,能帮你判断模板引用的可靠性,也能解释为什么前文所有链接都指向稳定路径。

6.1 内容检查脚本的约束

scripts/check-content.mjs 是全仓库的内容守门人,它对本文件施加了几类约束(对应实现):

  • Frontmatter 必备字段:每个公开页面必须包含 titledescriptionupdated 三键,且 updated 必须是 YYYY-MM-DD 且不晚于当前日期、description 不得过短(少于 24 字符会报错)。这也解释了模板文件顶部为什么有标准化的 frontmatter;
  • 链接目标必须存在:脚本会解析所有 Markdown 链接与 HTML href,检查解析后的本地文件是否真实存在(对应实现),因此文中「相对链接必须指向实际文件」不是建议而是仓库硬性规则;
  • 中英双语与标题层级对齐:英文页面必须在 docs/en 下有中文对应页,反之亦然,且两页的标题层级结构必须一致(checkBilingualParitycheckHeadingParity);
  • 过期字符串与隐私红线:脚本内置了一组 STALE_PATTERNS(残留旧站点域名、公开 QQ 号、失效网盘链接等),一旦命中即报错(对应实现),从机制上防止模板引用过期的外部资源。

6.2 Playwright 端到端测试的兜底

tests/site.spec.mjs 则从「页面能否真实渲染」层面兜底:它遍历导航中每个 source,逐一断言对应路由的 H1 可见且 main 区域可见(对应实现),并校验页面 meta[name="description"]、canonical、og:url 等元数据是否跟随路由。针对模板体系,测试还显式断言了英文版 Evidence Chain Template 页面包含「Save an Unaided Baseline」与「Test Delayed Retention」两个关键小节标题(对应实现),以及 Weekly Review 页面存在指向 Evidence Chain 与 Rhythm Ledger 的交接链接(对应实现)。换句话说,你阅读到的这些模板不是静态孤页,而是被测试持续守护、可被搜索引擎与 Agent 稳定锚定的内容节点。

七、落地步骤清单:从零完成一次标准诊断

把以上拆解收拢成可直接照做的操作序列:

  1. 先做 CEFR 自评:通读 CEFR Goals and English Self-check,完成其中四技能基线任务规格,判断自己处于哪个暂定区间;
  2. 选定真实话题与素材:在 Real use context 里写下一个真实使用场景,并让听、读、说、写四任务围绕同一话题展开;
  3. 写下限制条件与复测日期:明确限时、字幕、词典、AI 的使用边界,并填好 Day-30 retest dateWeek-12 retest date
  4. 四技能各做一次无辅助任务:产出 First sample,存放到明确路径;需要更细诊断时,分别落到 Listening Resource AuditReading Evidence CardSpeaking Evidence CardWriting Evidence Card
  5. 按五维打 0–2 分并写理由:对每项技能完成五列评分,且在结论区写下 Strongest/Weakest evidenceRepeated errorsProvisional CEFR by skill
  6. 安排最小下一步:填 Smallest next exercise,识别需要专业/一手来源核查的部分,确定 One variable to change next cycle
  7. 把变量交还给循环:打开 90-Day Cycle Map,将该变量写入下轮计划的对应位置;
  8. Day-30 与 Week-12 复测:在相同条件或接近平行任务下重做,并排保存原始样本、辅助版本、延迟表现与评分理由,而不是只比较润色后的成品。

这套流程的价值不在于给语言水平贴一个漂亮标签,而在于为下一次练习提供一个可比较的锚点——正如模板与配套的 CEFR 页面反复强调的:能力不是由自我感觉证明的,而是由你能够理解、表达并完成的东西,以及这些表现在时间和条件变化之后是否仍然成立来证明的。若希望把同一套「基线—证据—延迟—迁移」的方法延伸到英语之外(AI 学习、项目交付、生活实践),可继续阅读 Evidence: How Change Becomes VisibleLearning State Template

登录后查看全文
热门项目推荐
相关项目推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
33
18
ops-transformerops-transformer
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
1.14 K
2.74 K
pytorchpytorch
作为 Ascend for PyTorch 社区的核心组件,TorchNPU 是昇腾专为 PyTorch 打造的深度学习适配插件,使 PyTorch 框架能够直接调用昇腾 NPU,为开发者提供昇腾 AI 处理器的超强算力。
Python
857
1.35 K
docsdocs
暂无描述
Markdown
897
5.81 K
kernelkernel
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
531
595
ops-nnops-nn
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
920
1.84 K
jiuwenswarmjiuwenswarm
JiuwenSwarm 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。
Python
3.63 K
1.02 K
ops-mathops-math
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.36 K
1.46 K
cann-learning-hubcann-learning-hub
CANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。
Jupyter Notebook
1.02 K
518
AscendNPU-IRAscendNPU-IR
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
547
389