ECC benchmark-methodology:竞品九维加权基准评分法与张力图(Tension Plot)实战指南
ECC(Agent Harness 性能优化系统)内置了一套用于品牌/创意服务市场竞品分析的三技能流水线,其中 benchmark-methodology 是中间环节:它接收 competitive-platform-analysis 产出的分层竞品集合,按九个加权维度用显式 1–5 评分标准逐项打分,并绘制客户的"战略张力"二维图,最终输出可交付的竞品档案卡(profile card)。读完本文,你可以掌握这套方法的激活条件、九维权重体系、评分锚点定义、证据采集顺序、偏差控制机制与档案卡输出格式,并能将其复用到任何需要"可比、可辩护"竞品评分的场景。
一、技能定位:三技能竞品流水线的第二步
benchmark-methodology 的文档本体位于 .agents/skills/benchmark-methodology/SKILL.md(仓库同时提供 skills/benchmark-methodology/SKILL.md 这一发布版本,后者在 frontmatter 中额外声明了 license: MIT)。其 frontmatter 描述明确了它在流水线中的位置:
Use after competitive-platform-analysis has produced a tiered competitor set. Scores each competitor across nine weighted dimensions ... with explicit 1–5 rubrics and a tension-plot. Precedes competitive-report-structure.
即:
- 前置:competitive-platform-analysis 负责"决定评测谁"——识别、分层(Direct / Adjacent / Aspirational)、裁剪出 8–12 个可评测对象;
- 本技能:负责"如何打分"——把已分层的集合转化为可比、可辩护的分数;
- 后继:competitive-report-structure 负责"如何汇报"——把打分后的档案卡组装成决策级报告。
在仓库的技能注册体系中,该技能被列在 package.json 的 skills 清单(skills/benchmark-methodology/)与 manifests/install-modules.json 的安装模块清单中,属于可按模块安装的技能之一。另外,从源码结构看,它具备 Codex/CLI 侧的适配接口 agents/openai.yaml,其中声明了 display_name: "Benchmark Methodology"、short_description: "Score competitors across nine weighted dimensions" 以及 allow_implicit_invocation: true,表明 Agent 可以在无需显式指令的情况下隐式调用该技能。
该方法论的核心信条在文档开头即给出:一致性才是重点——"分数只有在任何竞品面对同样证据都能拿到相同分数时才有用"(Consistency is the point)。因此整套方法围绕"证据锚定"与"跨集合校准"两个支点展开。
二、激活条件(When to Activate)
文档列出了四个激活前提,缺一不可:
- 来自
competitive-platform-analysis的、已完成范围限定与分层的竞品集合已就绪; - 需要的是跨竞品的可比、证据锚定的分数,而不是"凭感觉的排名"(gut-feel rankings);
- 客户的战略张力(strategic tension,即定义其目标空白的成对坐标轴)已经确立;
- 准备为
competitive-report-structure产出待组装的档案卡。
文档还专门列了一条反模式对应项:"在竞品集合尚未完成 scope 之前就开跑"——直接对未限定的列表打分会把精力浪费在不相关的竞品上。
三、前置输入:客户定位简报(Positioning Brief)
打分之前必须先建立客户的定位简报,它是后续所有维度判定的"标尺来源",提供三样东西:
- 战略张力(Strategic tension)——两条坐标轴(例如 memorability × hireability,"可记忆性 × 可雇佣性"),两轴交点即客户的目标空白区。第 9 维度永远是客户命名出的这条张力;两个极点必须分别计分、分别报告,永远不许取平均。
- 差异化优势(Differentiator)——客户护城河所在,它决定了哪些维度在客户的定位论证中权重感更强。
- 品牌平衡(Brand balance)——客户有意的战略侧重配比;任何会打破这一配比的战略建议都必须显式标记出来。
四、九个维度与权重体系
方法的第一原则是:客户是在两条极点之间的特定张力上竞争,而不是靠服务广度取胜。因此维度权重向该护城河倾斜。文档特别强调:权重用于"综合阶段的侧重引导",不是用来合成一个加权总分(详见偏差控制)。九维及权重如下(总和 = 100%):
| # | 维度 | 权重 | 判定要点 |
|---|---|---|---|
| 1 | 定位清晰度与独特性(Positioning clarity & distinctiveness) | 18% | 工作室的定位是否锋利、可独占、一眼可辨?还是泛泛而谈? |
| 2 | 品牌声音 / 语言独特性(Brand voice / verbal distinctiveness) | 15% | 文案是否拥有可独占的语域(register)?还是可互换的"机构腔"? |
| 3 | 视觉识别与站点工艺(Visual identity & site craft) | 15% | 视觉系统的质量与所有权;把站点当作"工艺证明"来看 |
| 4 | 服务供给与包装(Service offer & packaging) | 12% | 是否产品化、可读(有命名的 sprint/audit)?还是含糊不清?包装成熟度如何? |
| 5 | 证据与可信度(Evidence & credibility) | 12% | 具名客户、量化结果、案例深度。超越"宣称"的证明 |
| 6 | 企业级就绪度 / 商业成熟度(Enterprise-readiness / commercial maturity) | 10% | 是否有接住并留住 SaaS/金融科技/B2B/企业级业务的信号(流程、客户 logo、规模、合同) |
| 7 | 思想领导力 / 内容存在感(Thought leadership / content presence) | 8% | 自有 POV:写作、演讲、newsletter、框架。重深度而非数量 |
| 8 | 定价透明度与合作模式(Pricing transparency & engagement model) | 5% | 定价/合作方式是否可读?产品化、定制还是不透明? |
| 9 | 客户的战略张力(Client's strategic tension) | 5%(作为标记位);两极分别计分、分别报告 | 张力名称与坐标轴描述从客户定位简报读取;两轴都画出来,"差距即洞见"。客户的目标象限是本次基准评测中最重要的单项发现:还有谁已经待在那里? |
从权重设计可以看出倾向:定位(18%)+ 声音(15%)+ 视觉(15%)合计近半,反映"品牌独特性"是这个市场的主要竞争货币;而"定价透明度"仅 5%,因为它更多是定位成熟度的结果而非定位本身。第 9 维度权重只有 5%,但文档反复强调它是"最重要的发现"——低权重是因为它不参与维度比较,它承担的是"象限判断"这一独立职能。
五、1–5 评分标尺(适用于维度 1–8)
标尺要求"把每个分数锚定到可观察的证据上"。文档给出的通用锚点描述(具体到各维度时应改写措辞,但等级含义必须保持不变):
- 1 — 缺失 / 泛化(Absent / generic):无可辨识的定位或工艺;与模板无从区分;是主动负债。
- 2 — 低于水准(Below par):有些意图,但不一致、衍生或不可信;放不进并排对比。
- 3 — 合格 / 入场券(Competent / table-stakes):扎实、专业、平淡;达到预期,但谁也无法据以独占。
- 4 — 强 / 有辨识度(Strong / distinctive):明显高于同行;是买家会注意到并引用的真实强项。
- 5 — 定义品类(Category-defining):同类最佳、可独占、难以模仿;是别人拿来对照的标杆。
张力轴(第 9 维度)——每轴各打 1–5
轴的名称及其 1/3/5 锚点从客户定位简报中读取。文档给了一个"memorability × credibility"(可记忆性 × 可信度)张力的示例锚点:
- Memorability — 1:瞬间被忘记 · 3:在语境中可被认出 · 5:过目不忘、被人谈论、被独特地拥有。
- Credibility — 1:感觉冒险/业余 · 3:安全、能干、无趣 · 5:企业级信赖、显而易见的稳妥之选。
然后把竞品画到张力 2×2 图上。客户的目标象限在定位简报中已命名,"目标象限里还有谁"就是本次基准评测最重要的单项发现。
六、数据采集:按"最便宜信号优先"的顺序
对每个竞品,按以下顺序走维度(从成本最低的信号源开始):
- 竞品自己的站点——定位、声音、供给包装、定价姿态、具名客户、manifesto/POV。截图首页 + 一个案例页。
- 案例研究 / 作品——证据深度、量化结果、客户名称。区分 asserted("我们交付了 X")与 proven(有指标、有名称、可核验)。
- 点评目录(review directories)——交叉印证客户、项目体量、合作模式 → 服务于可信度与企业级就绪度两个维度(例如 Clutch.co 或该细分领域的等价物)。
- LinkedIn——团队规模/模式、创始人叙事、内容更新频率 → 服务于思想领导力维度与合作模式判断。
- 作品集 / 工艺平台——工艺语域(使用该细分领域原生的展示平台:设计板、showreel、已发布样稿等)。
- 内容渠道——newsletter/演讲/写作 → 思想领导力的深度。
每个维度需要记录三样东西:分数、一行式理由、以及拿到该分数的来源链接/截图。没有证据就没有分数(No score without evidence)。
这一顺序与前序技能 competitive-platform-analysis 的"数据源清单"(组合平台、奖项/策展展示、竞品站点、LinkedIn、点评目录、公开作品、会议/播客/newsletter)一一对应,并额外加了一条贯穿两个技能的纪律:任何竞品属性在被当作事实之前,必须至少用两个来源交叉验证——自报的站点文案是营销,不是事实。
七、偏差控制(Bias controls)
这是本文档最有方法论价值的小节,共六条:
- 不设单一综合分(No single composite score)。维度分数与张力图分开报告;加权平均会掩盖真正重要的不对称性。
- asserted 与 proven 之别。对无法交叉印证的自报声明,下调可信度/证据维度分数。站点文案是营销,不是事实。
- 审美亲和偏差(Aesthetic affinity bias)。评审者容易给与自己审美相投的工作室打高分,同时低估对手的商业实力。工艺(craft)与可信度(credibility)必须独立计分;一个"无聊"的站点可能正在拿下更大的客户。
- 时新 / 炫技偏差(Recency / flashiness bias)。获奖的展示级作品令人惊艳,但可能缺乏商业深度——在打分可信度之前,先用点评目录/客户来验证。
- 幸存者偏差(Survivorship)。可见的、善于营销的工作室不等于整个市场;要把经由目录/点评发现的"强但安静"的运营者也记录在案。
- 跨集合校准,而不是孤立校准(Calibrate across the set, not in isolation)。定稿前把所有分数并排重读一遍——一个"4"必须对所有竞品意味着同一件事;离群值要调整。
其中第 1 条与后继技能形成了强约束:competitive-report-structure 的报告矩阵同样"禁止添加加权合计列(blended total column)",其反模式清单中也明确把"给矩阵加混合总分列"列为显式排除项。两处文档互相咬合,确保"不做伪综合分"从打分阶段一直延续到汇报阶段。
八、竞品档案卡:输出格式
每个被评测的竞品产出一张档案卡——这是报告组装的最小原子单元。完整模板如下(原文结构完整保留,占位符需按实际评测对象填写):
## <Competitor name>
- **Profile / Tier:** <positioning stance · specialization · size band> / <Direct | Adjacent | Aspirational>
- **One-liner:** <how they position themselves, in their words>
- **Model / size / geography:** <solo|micro|boutique> · <region> · <pricing/engagement model>
- **Notable clients / evidence:** <named, with proven/asserted tag>
### Dimension scores
| Dimension | Score (1–5) | Justification (1 line) | Source |
|---|---|---|---|
| Positioning clarity & distinctiveness | | | |
| Brand voice / verbal distinctiveness | | | |
| Visual identity & site craft | | | |
| Service offer & packaging | | | |
| Evidence & credibility | | | |
| Enterprise-readiness / commercial maturity | | | |
| Thought leadership / content presence | | | |
| Pricing transparency & engagement model | | | |
### Tension plot
- **[Axis 1 from positioning brief]:** <1–5> — <why>
- **[Axis 2 from positioning brief]:** <1–5> — <why>
- **Quadrant:** <high/high | high-1/low-2 | low-1/high-2 | low/low>
### Read for [client]
- **Strength to learn from:** <…>
- **Weakness to exploit / white-space it exposes:** <…>
- **Threat to [client]:** <…>
模板中有几个设计细节值得注意:
- Tier 字段直接承接前序技能的三层分类(Direct / Adjacent / Aspirational),保证档案卡与竞品集合的范围决策可追溯;
- Notable clients / evidence 要求带 proven/asserted 标签,把偏差控制第 2 条落到了卡片字段层面;
- Tension plot 的两轴名称不写死,而是从定位简报读取(Axis 1 / Axis 2 from positioning brief),使同一套模板可复用于任何张力定义;
- Quadrant 四态(high/high、high-1/low-2、low-1/high-2、low/low)把"两极是否同时占优"显式化,这正是文档所说的"客户的战略问题恰恰是对手是否同时做到两件事";
- 卡片收尾的 Read for [client] 把纯描述转化为对客户的三问:可学之处、可利用的弱点/空白、以及威胁判断。
完成后的档案卡连同张力图一起交给 competitive-report-structure 组装成客户可交付报告。
九、反模式清单(Anti-Patterns)
文档把最常见的执行错误固化为五条禁令:
- 对张力轴取平均。客户战略张力的两个极点必须分别计分、分别报告;取平均会摧毁洞见——两极之间的差距本身就是发现。
- 无证据打分。每个分数都要求一行式理由 + 来源链接。没有证据的分数是观点,不是基准。
- 制造单一综合分。逐维度报告分数;加权平均会掩盖定位决策真正关心的不对称强项。
- 不校准就套用通用标尺锚点。1–5 锚点必须针对具体维度和竞品集合做校准;通用描述只是起点,不是固定标准。
- 在竞品集合完成 scope 之前开跑。先用
competitive-platform-analysis产出分层、裁剪后的集合;对未限定列表打分会浪费在不相关竞品上。
十、小结与延伸阅读
benchmark-methodology 的价值不在于九个维度的命名,而在于三组纪律:输入纪律(必须先有定位简报与分层集合)、评分纪律(证据锚定、跨集合校准、张力两极永不平均)与输出纪律(原子化档案卡、字段级 proven/asserted 标记)。这些纪律使其产出的分数可以在下一环节直接进入 competitive-report-structure 的基准矩阵与张力图,而不会在"组装"阶段被质疑口径。
配套阅读路径:
- 前序技能 competitive-platform-analysis:如何识别、分轴、分层并裁剪竞品集合(含 10–18 候选 → 8–12 评测对象的预筛选矩阵模板);
- 后继技能 competitive-report-structure:八段式报告结构、热力图矩阵呈现与"必须回答的三个决策问题";
- 定位简报来源 brand-discovery:产出战略张力与品牌平衡等前置输入的技能。
适用前提说明:该技能面向品牌/创意服务类市场(工作室、代理机构等)的竞品基准场景,维度与数据源假设(站点工艺、点评目录、作品集平台)以此为基准;移植到其他行业时,需按文档自身的校准条款替换维度具体锚点与数据源,但等级含义、证据要求与"不做综合分"的约束应当保持不变。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0623
Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家(MoE)旗舰模型。模型总参数量 770B,每个 token 激活 49B,主干共包含78层,第一层采用标准 FFN,其余 77 层均为 MoE 结构,每层包含 256 个路由专家与 1 个共享专家,每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP(总参数量 10B,激活 0.7B)以支持投机解码。Python00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2Jinja00
Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00