RuView RaBitQ 相似性传感器管线扩展(ADR-085):七个新增接入站点的设计、验收与落地路线
本文是 RuView 仓库内架构决策记录 ADR-085 的深度解读。该 ADR 以 ADR-084 已落地的 RaBitQ 二进制 sketch 相似性传感器为原语,将其统一接入范式(先 sketch、命中不到再精排、以 witness hash 替代原始向量存储)推广到 REST 检索、WiFi 扫描、mmWave 门控、CI 发布、集群路由与事件分析七个新增站点。读完本文,你将掌握 RuView 管线中“是否见过类似信号”这一类问题的一等公民化改造思路,理解每个站点的 sketch 内容、触发时机、miss 精排回退与 witness hash 设计,以及七条独立可回退的实施验收路径。
背景:ADR-084 奠定的 sketch 原语不再是开放问题
RuView 的信号管线在多处都会产生稠密浮点 embedding:AETHER 128 维 re-ID 特征、ADR-076 的 CSI 频谱图 embedding、每房间场模型特征向量、多基地融合向量等。它们最终都回答同一类问题——"我之前是否见过类似的东西?"。传统做法是对候选集合做全量浮点点积 / Mahalanobis 距离比较,成本随存储向量数量线性增长,在多基地动态 mincut 图维护、re-ID 重打分等场景下甚至呈二次增长。
ADR-084 把这个观察提炼为一个关键洞察:RaBitQ 风格 sketch 不只是向量压缩技巧,而是一种廉价的相似性传感器。其部署范式在 ADR-084 中统一为:
dense embedding ──► RaBitQ sketch ──► hamming/popcnt compare
├──► candidate set (top-K)
└──► novelty score (0..1)
│
▼
┌── below threshold ──► emit summary, no escalation
│
└── above threshold ──► full-precision refinement
├──► ruvector mincut / HNSW
├──► AETHER re-ID rescoring
└──► pose model / CNN wake
每一行的决策边界都不变——全精度依然拥有最终决定权,sketch 只充当"门控哪些比较需要真正执行"的传感器,从不改变"比较结果由什么决定"。
这一模式在源码层已经落地为 sketch.rs 模块。文件中头部注释直白写道:管线里每个"have I seen something like this before?"比较(AETHER re-ID、房间指纹、mincut 预过滤、novelty 检测、mesh 交换压缩、隐私事件日志)共享同一形态:稠密浮点 embedding → 相似度打分 → top-K 候选。全精度比较每对要 O(d) 次浮点运算且缓存不友好;1-bit sketch(每维 1 bit、按字节打包)把比较折叠成一次硬件加速的 POPCNT/NEON-vcnt,内存仅约 1/32。ADR-084 Pass 1 在 d=512 上测得的比较加速比为 43–51×、1024 个 sketch 上 k=8 的 top-K 加速 7.5×,已超过 8× 验收线。
sketch 原语本身已不再是开放问题;真正的问题是:管线中还有哪些"是否熟悉"的比较点值得套用同一传感器。
ADR-085 的统一规则:一页看懂七个站点共有的四元组
ADR-085 将新增的七个站点统一到一个模式里。每个站点都用文档明确规定的四元组描述:
- (a) what is sketched —— 对什么内容生成 sketch;
- (b) what triggers the comparison —— 什么事件触发比较;
- (c) what the refinement step on a miss is —— miss(未命中)时如何精排回退;
- (d) what artifact stands in for the raw embedding —— 用什么替代原始向量进入存储,即 witness hash。
| 站点 | 被 sketch 的对象 | 触发时机 | miss 精排回退 | 主要目标 |
|---|---|---|---|---|
| Site 1 | 每类质心 μ_k | 每次分类调用前 | Hamming top-K(3) 选候选类,Mahalanobis 只跑 K 个 | 单帧分类时延 ≥2× 下降 |
| Site 2 | 每段录像的汇聚签名 | GET /api/v1/recordings/similar |
可选 &refine=true 全 embedding 重排 |
免长期 embedding 存储的相似录像检索 |
| Site 3 | 每 BSSID 滚动窗口特征向量 | 每次多 BSSID 扫描 tick 后 | 汉明距离超阈值 → 标记 AP novelty | 稳定部署下低误报的 AP 新异检测 |
| Site 4 | 每帧雷达签名向量(~10 Hz) | 每帧进入重 DSP 前 | 距离内"无新事件",超阈值唤醒呼吸/心率 DSP | 静默房 vital DSP 能耗降 ≥4× |
| Site 5 | 每次 release 的 witness bundle 指纹 | CI release 生成 bundle 后 | 与上一 release 距离超阈 → 标 drifted | 不误报依赖升级的漂移棘轮 |
| Site 6 | 每个 Cognitum Seed 的历史 bank 签名 | 节点向 swarm 升级事件时 | 无邻近 peer → 广播全量 | 事件路由由 O(n) 风暴降到 O(1) |
| Site 7 | 最近 1 小时事件窗的池化特征 | 每 5 分钟刷新 tick | 距历史 bank 超阈 → 集群级告警 | 隐私边界内的异常行为检测 |
统一纪律:sha256(sketch_bytes || stable_metadata || sketch_version) 作为存储边界的 witness hash,替代原始 embedding/特征向量——这正是 ADR-084 为集群 Pi 事件日志引入的隐私姿态向七个新场景的推广。
底层原语复用:sketch.rs 提供的稳定 API 面
七个站点共同依赖的 sketch.rs 在仓库中实际存在(ADR-084 Pass 1,分支 feat/adr-084-pass-1-sketch-module),为七站点提供了稳定、已带安全加固的 API:
Sketch类型(见 sketch.rs 的 Sketch 结构定义):持有一个BinaryQuantized(1-bit/维打包)、embedding_dim: u16与sketch_version: u16。构造入口Sketch::from_embedding(&[f32], sketch_version)实现标准符号量化(每维> 0.0记 1,否则记 0);带旋转的 Pass 2 版本from_embedding_rotated会先经确定性随机正交旋转R = H·D(Fast Hadamard + 种子化 ±1 符号翻转,见 rotation.rs)再量化,使各符号位携带更多独立信息。Sketch::distance(sketch.rs):返回两个 sketch 的汉明距离,且在embedding_dim或sketch_version不一致时返回类型化SketchError——这是版本纪律的代码级保障,防止静默比较不同代模型的产物。SketchBank(sketch.rs):携带稳定 id 的 sketch 库,首插即锁定embedding_dim与sketch_version,后续不匹配插入直接拒绝。提供insert、topk(返回按距离升序的(id, distance)列表,O(n log k) 部分 top-K)以及novelty(定义为min_distance / embedding_dim,0.0 表示库中存在完全一致项,1.0 表示与最近项逐位全异,空库返回 1.0)。WireSketch(sketch.rs 的 wire 格式):sketch + novelty 的跨通道序列化。帧头 12 字节(magic0xC511_0084、format_version、sketch_version、embedding_dim、novelty_q15 定点),加上ceil(dim/8)的 packed bits;128 维 AETHER sketch 全量恰好 28 字节。反序列化路径对 magic、版本、dim→字节数一致性、总大小逐一校验,抵御非 RuView 发送者的畸形包与内存耗尽攻击。- 源码测试面:同文件内嵌测试覆盖了汉明距离语义、版本/维度拒绝、bank 模式锁定、空库 novelty=1.0、proportional novelty(半维翻转 → 0.5)等;还保留了一个关于
topk堆路径 bug 的回归测试topk_heap_path_returns_nearest——n > k堆路径曾误用 min-heap 返回 k 个最远邻居(见 sketch.rs),后由 ADR-156 §8 修复并压测固定。
这里要点名两个事实:其一,文档注释确认 Pass 2 的旋转与 Pass 2b 的无偏距离估计器(estimator.rs,Gao & Long SIGMOD 2024 中 1-bit 编码 + 每向量 8B 边信息重建内积估计)均已实现并测出覆盖度提升,详见 ADR-156 §8/§10/§11;其二,ADR-085 自身状态为 Proposed,七个站点的接入实现大部分尚未落地,下文描述的是该 ADR 规划的设计决策与验收标准,而非仓库现状。
七个新增站点的设计逐点拆解
Site 1 — 房间级自适应分类器短路
- Crate 落点:
wifi-densepose-sensing-server的 adaptive_classifier.rs(每类质心与散布、逐帧 Mahalanobis 类距离)。 - Sketched:每类的质心
µ_k(本身已是定长特征向量)。sketch 存放于按 class id 索引的SketchBank,类被重训练时重建。 - Trigger:每次分类调用、float Mahalanobis 距离循环开始之前。
- Refinement on miss / first cut:Hamming top-K(K=3)先选候选类,Mahalanobis 只对这 K 个候选执行;若 hamming top-1 与最终 Mahalanobis 胜者不一致,记录分歧并对该帧退回全类全量评估。
- Witness hash:训练期一次性记录、随 sketch 一起存储的
sha256(centroid_bytes || spread_bytes || sketch_version)。
源码侧印证:仓库中的 adaptive_classifier.rs 当前实现确实采用"per-class mean/stddev + Mahalanobis-like 加权距离 + logistic 回归软边界"三层结构,classify 接口(adaptive_classifier.rs)对 15 维特征(7 个服务端特征 + 8 个子载波统计特征,见 N_FEATURES 常量)做全局标准化后经 logits → softmax 选 argmax。文档特别强调:sketch 只负责收窄,Mahalanobis 仍对 K 个候选作最终裁决,从而保留原始的"到类距离"语义。把 Mahalanobis 换成标准 RaBitQ 精确距离重排步骤(Gao & Long 2024)据作者所知尚无先例——列为开放问题 Q1。
Site 2 — 录像相似检索 REST 端点
- Crate 落点:
wifi-densepose-sensing-server的 recording.rs 加 main.rs 的新 HTTP handler。 - Sketched:每段录像的池化 CSI/embedding 签名——整段录像的 AETHER embedding 均值,或按 ADR-076 的频谱图 embedding 均值。每录像一个 sketch,存于录像元数据旁。
- Trigger:
GET /api/v1/recordings/similar?to=<id>&k=N请求。 - Refinement on miss:Hamming top-K 返回候选录像 id 列表;全 embedding 精排是opt-in的,通过
&refine=true查询参数加载候选录像全量 embedding(若存有)并重排。默认行为是 sketch-only——该端点以"放弃精确排序"换取"服务端无需存全量 embedding"的发布能力。 - Witness hash:
sha256(sketch_bytes || recording_id || sketch_version)作为结果行的标识符返回给客户端,用于断言是哪个 sketch 产生了该匹配;原始 embedding 默认不保留。
仓库现状佐证:GET /api/v1/recordings 列表能力已存在于 main.rs 的 list_recordings 与 recording.rs 的 list_recordings;而 similar 端点尚未实现。设计上该形态比 Qdrant 的 /collections/{name}/points/search(会返回全向量)更接近 SimHash 去重 API——这是文档明言的有意取舍,详见开放问题 Q4。
Site 3 — WiFi BSSID 指纹识别(信道跳转调度器输入)
- Crate 落点:
wifi-densepose-wifiscan新增bssid_sketch模块(与现有 scan/result 类型并列)。 - Sketched:每个 BSSID 的短时序特征向量——近期 RSSI、SNR、信道、beacon 间隔、能力标志——在滚动窗口(如最近 60 秒)上池化。每 (BSSID, window) 一个 sketch。
- Trigger:每次扫描 tick、多 BSSID 扫描完成后;当前窗口 sketch 与前序窗口 bank 比较。
- Refinement on miss:最近邻汉明距离超过阈值的 sketch 将该 BSSID 标为 novel(新出现,或已知 AP 变化到无法识别)。跳转调度器(ADR-073 拥有)把 novelty 当作提示:下一轮轮转时给受影响信道更多 dwell time。
- Witness hash:
sha256(bssid || pooled_features || sketch_version || window_end_unix)存入每 AP novelty 日志;原始 BSSID 时序在 sketch 生成后被丢弃。
这是对异构低维向量的异常检测,其验收指标是稳定部署上的误报率而非 top-K 覆盖率。ADR-085 特别澄清范围:IEEE 802.11bf-2025(2025 年 3 月发布)标准化了 WLAN sensing 测量帧,但并未标准化 BSSID-novelty 启发式,故该站点不与标准重复(与开放问题 Q5 呼应)。
Site 4 — mmWave 雷达签名记忆
- Crate 落点:
wifi-densepose-vitals的 preprocessor.rs 与 anomaly.rs(LD2410 / MR60BHA2 输入路径)。 - Sketched:每帧雷达签名向量——range bins、Doppler bins、峰值频率——按雷达输入节奏(约 10 Hz)生成 sketch。
- Trigger:每帧进入重型 vital signs DSP 之前。当前 sketch 与小型 per-room "我们是否见过此类帧" bank 比较。
- Refinement on miss:距离某已知签名在汉明阈值内的帧直接短路为"无新事件",vital DSP 保持休眠;超阈值的帧唤醒完整呼吸/心率管线(
vitals::breathing、vitals::heartrate)一帧或多帧,bank 更新稳定后重新入睡。 - Witness hash:
sha256(signature_bytes || sensor_kind || sketch_version)存入 vitals 事件日志;原始雷达帧不保留超过滚动预处理缓冲。
源码侧印证:仓库中 preprocessor.rs 已有 EMA 预测式 CsiVitalPreprocessor(esp32_default 使用 56 子载波、α=0.05),呼吸/心率模块 breathing.rs、heartrate.rs 均在位。文档点明节能是卖点:band-pass + phase-fusion + 呼吸/心跳 FFT 构成的 vital DSP 是集群 Pi 静默房间单位分钟内最贵的操作;已发表的 FMCW 管线把 DSP 视为 presence 后常开,而"per-room 雷达签名 bank 之上的二进制 sketch 唤醒门控"未找到任何原始来源——这是对 ADR-084 novelty 传感器的直接扩展。
Site 5 — Witness bundle 相似度(ADR-028 发布 CI 信号)
- Crate 落点:库外——扩展现有 scripts/generate-witness-bundle.sh 并新增
scripts/witness_drift_check.py。 - Sketched:每次 release 的 witness bundle "指纹"——由各组件 SHA-256 前缀 + 数值型 attestation 值(测试计数、proof hash 字节段、各固件体积)构成的定长向量。每 release 一个 sketch。
- Trigger:CI release job 内、witness bundle 生成之后发布之前运行。
- Refinement on miss:与上一 release 的汉明距离超阈值的 sketch 将 release 标为 drifted,并在 CI summary 中列出变化组件。release 不会被阻塞;该信号是一个"棘轮",提示"这些组件相对近期基线变化过大,请再检查一次"。
- Witness hash:
sha256(sketch_bytes || release_tag || sketch_version)以WITNESS-LOG-<sha>.sketch形式随 bundle 发布。bundle 本体仍是既有产物,sketch hash 只是 32 字节追加。
这是对该传感器的保守用法——对极小候选集(最近 5–10 个 release)做漂移检测。文档明确:现有 CI drift 先例是 autoencoder/SHAP 的 commit-anomaly 检测加 PKI 签名产物完整性,"release-bundle 指纹上的二进制 sketch 作 CI 信号"未找到原始来源。验收语是"不因每次依赖升级就误报的有用棘轮";若不达标,sketch 步骤直接从 release 脚本移除——七个站点中最容易回退的一个。
Site 6 — Agent / swarm 内存路由
- Crate 落点:
wifi-densepose-sensing-server的 multistatic_bridge.rs(ADR-066 swarm-bridge 信道)及对端 Cognitum Seed 注册元数据。 - Sketched:每个 Cognitum Seed 累积的历史 bank 签名——其滚动周期内存储 sketch 的池化均值。每 peer Seed 一个 sketch,随 peer 心跳节奏刷新。
- Trigger:传感器节点向 swarm 升级事件时。广播给所有 peer Seed 之前,集群 Pi 先计算事件的 sketch,按汉明距离路由到最近 peer。
- Refinement on miss:无邻近 peer(全部汉明距离超阈值)→ 广播所有;有邻近命中 → 先单播该 Seed,仅当被路由 Seed 无法解析时才升级为广播。
- Witness hash:
sha256(event_sketch || origin_seed_id || routed_seed_id || sketch_version || event_unix)记入 swarm-bridge 审计日志。完整事件 sketch 会被交换,hash 是路由决策的 attestation。
数值动机很直观:12 个 Seed 的 swarm 若每事件全广播就是 O(n) 消息风暴;sketch 路由把常见情形降为 O(1),保留 O(n) 兜底。文档给出的最近可比物是 MasRouter(ACL 2025,用学到的 DeBERTa router 路由 LLM 查询);ADR-085 变体结构相似,但用未学习的汉明比较对每个 peer 的池化 bank,更廉价且对 peer churn 更鲁棒。
Site 7 — 日志 / 事件流模式检测
- Crate 落点:
wifi-densepose-sensing-server新增src/event_anomaly.rs模块,读取集群 Pi 既有事件流。 - Sketched:近期事件窗口(默认最近一小时)上的池化特征向量——各事件类型计数、平均事件间隔、来源分布。每集群一个 sketch,每 5 分钟刷新。
- Trigger:每次刷新 tick。当前小时 sketch 与历史 bank(过去 24 小时的逐小时 sketch)比较。
- Refinement on miss:汉明距离超阈值将当前小时标为异常行为;集群 Pi 只发出单条集群级告警,告警体是指向 witness hash 的指针而不是原始事件。任何原始事件都不随告警离开 Pi。
- Witness hash:
sha256(hourly_sketch || cluster_id || hour_unix || sketch_version)作为告警体记录;原始事件留在集群 Pi 的既有隐私边界之后。
文档自评为七个站点中最"名副其实的异常检测",也最暴露于非向量 witness-hash 开放问题——事件特征是需在 sketch 前归一化的混合计数与速率。最近可比物是 Salesforce 的 LogAI(Drain parser → counter vectors → 无监督检测);ADR-085 变体对 counter vector 做 sketch,用召回率换取集群 Pi 上的常量内存与亚毫秒比较。
Witness-hash 纪律
每个站点都在存储边界用 witness hash 取代原始 embedding/特征向量,统一格式为 sha256(sketch_bytes || stable_metadata || sketch_version)。对原生不是稠密向量的输入(Site 5 的 release bundle、Site 7 的事件流),如何编码成可 sketch 形状本身就是设计决策——Site 5 用数值型 SHA 前缀段、Site 7 用归一化事件类型直方图,两者均列入开放问题 Q2。
影响评估
正面影响:
- "is this familiar?" 模式升级为一等公民部署原语,横跨 REST API、扫描子系统、mmWave 门控、CI、swarm 路由与事件分析。单站点各是小胜,合起来则消除了"在每条存储与交换路径上都保留全量 embedding"的最后借口。
- 集群边界处的能耗与带宽收益叠加:Site 4 削减 vital DSP 占空比,Site 6 削减跨集群广播负载,而两者都在最讲究瓦数的集群 Pi 上。
- 隐私叙事加强:每个站点都存 witness hash 而非原始数据;Site 2 与 Site 7 被显式设计成"可以不保留其索引的 embedding / 事件负载即可上线"。
- 无新增依赖地复用 ADR-084 Pass 1:
wifi-densepose-ruvector::sketch已暴露Sketch/SketchBank/SketchError,测得的比较加速比已远高于门槛。 - 每站点独立可测、独立可回退:七个 pass 不共享数据路径,任何一处失败回滚都不会波及其余。
负向影响 / 风险:
- Mahalanobis 分布假设(Site 1):纯 1-bit 符号量化在零中心、各向同性 embedding 上表现最好,而 Mahalanobis 显式编码了汉明距离不敏感的协方差结构。sketch 仅作候选收窄、Mahalanobis 重打分保留语义——但若 hamming top-K 系统性地排除真胜者,短路反而比不短路更糟。验收测试守卫该点;必要时需引入 RaBitQ 论文式随机旋转预置(见 Q1)。
- REST 端点形态(Site 2)是 API 表面承诺:sketch-only 默认 +
&refine=true的契约要求客户端接受近似召回行为,文档化是验收项本身。 - Site 3 在动态环境中的误报风险:咖啡店/共享办公场景 BSSID 频繁轮换,信号必须标记意外变化而非背景 churn,验收按此设定。
- 非向量输入的 witness-hash 格式(Site 5、7):把非稠密数据编码为可 sketch 形状本身可被未来模型变更破坏;
sketch_version升级会使所有 bank 失效,但只有 Site 5/7 需要重编码原始输入。 - 运维表面积:七个 bank 各有持久化、版本偏差与刷新策略,集群 Pi 状态显著增多。ADR-083 的 secure-boot/OTA 故事仍然成立,但
sketch_version升级时的状态重建成本从 1 个 bank 变成 7 个。
中性影响:
- ADR-084 的五站点与此处七站点相互独立,任何站点的验收/回滚都不传导。
- ADR-082 的 confirmed-track filter 保持在每次 sketch 调用的上游;ADR-081 的 5 层固件内核不变——所有新 bank 都位于集群 Pi 或更上层。
- ADR-027(MERIDIAN 跨环境泛化)干净交互:Site 1 的每类 sketch 按构造即按环境划分,正是 MERIDIAN 已假设的形状。
实施路线:七个 Pass 与单行验收测试
七个 pass 按"最便宜/最低风险优先"排序,各自可独立发布;每个 pass 在下一 pass 启动前必须通过自身的单行验收测试:
| # | Pass | 目标 crate / 脚本 | 验收测试(一行) |
|---|---|---|---|
| 1 | Witness bundle drift sketch(Site 5) | scripts/witness_drift_check.py |
在最近 5 个 release 上跑 CI:对已知依赖升级 release 产生 ≥1 个 drift flag,对已知无操作 release 产生 0 个 flag。 |
| 2 | BSSID fingerprint novelty(Site 3) | wifi-densepose-wifiscan::bssid_sketch |
稳定办公室 24 小时浸泡:novelty rate ≤ 5 事件/小时;受控新 AP 注入:2 个扫描周期内触发 novelty。 |
| 3 | mmWave signature gate(Site 4) | wifi-densepose-vitals::preprocessor |
稳态空房间下 vital DSP CPU 时间/小时较无门控基线下降 ≥4×;既有呼吸/心跳 fixtures 上漏检回归 ≤1pp。 |
| 4 | Adaptive classifier short-circuit(Site 1) | wifi-densepose-sensing-server::adaptive_classifier |
K=3 候选下逐帧 classify 时延降 ≥2×;留出测试集上分类准确率回归 ≤1pp。 |
| 5 | Event-stream anomaly sketch(Site 7) | wifi-densepose-sensing-server::event_anomaly |
7 天滚动部署:≤1 个每日假异常;注入合成异常小时在 1 个刷新 tick 内触发。 |
| 6 | Swarm memory routing(Site 6) | wifi-densepose-sensing-server::multistatic_bridge |
12-Seed 模拟 swarm:单事件广播消息数较无路由基线降 ≥5×;被路由 Seed 解析率 ≥80%。 |
| 7 | Recording-search REST endpoint(Site 2) | wifi-densepose-sensing-server::recording + HTTP 路由 |
GET /api/v1/recordings/similar 对录制数据集返回的 top-K 与全 embedding 重排候选集一致率 ≥90%;1000 段录像、K=10 时响应 <50 ms。 |
ADR-084 的一般性验收数字——比较成本降 8–30×、top-K 覆盖率 ≥90%、准确率回归 <1pp——对候选集大、以 top-K 覆盖率为正确框架的 Site 1(分类器)与 Site 2(录像检索)原样适用。Site 3/4/5/6 是门控/异常/路由问题,按上表各自的站点专属判据(误报率、DSP 占空比、广播计数、漂移 flag 精度)衡量。每个 pass 在 v2/crates/<target>/tests/ 下新增三个测试:property test(适用处 sketch ↔ float top-K 一致)、criterion bench(比较成本比)、对录制数据的端到端回归;bench 复用 ADR-084 Pass 1 的 harness。
验证方案
ADR-085 状态为 Proposed。验收要求七个 pass 中至少四个达到各自验收测试,且四个必选项是:Site 1(逐帧成本;Mahalanobis 假设承重)、Site 4(集群 Pi 能耗)、Site 6(跨集群带宽)、Site 7(隐私保护异常检测)。Site 2、3、5 为加分项,可独立发布或回退。
验证将在以下环境中进行:
- 既有 workspace 测试保持绿色:
cargo test --workspace --no-default-features(在v2/下执行); - 实验室 fixture 上的 7 天集群 Pi 浸泡(3 传感器节点 + 1 Pi,按 ADR-083),录像、mmWave、BSSID 扫描全激活,逐站点日志对照 Implementation 表评分;
- Python proof harness 不变:verify.py 必须仍打印
VERDICT: PASS; - 重新生成含 Site 5 sketch 的 witness bundle(ADR-028)。
当四个必选项通过且浸泡成立,ADR 由 Proposed → Accepted,README 的硬件/特性表将新增一行 sketch-bank。
五个开放问题
- Site 1 上 Mahalanobis 预过滤能否扛住符号量化偏差? 纯 1-bit sketch 丢弃了 Mahalanobis 所用的协方差结构。Pass-1 框架(sketch 收窄、Mahalanobis 裁决)在期望意义上保正确性,但对抗性质心几何可能让 hamming top-K 系统性排除真胜者。未找到"binary-sketch + Mahalanobis-refine"作为已发表管线的原始来源,标注为推测,由 Site-1 验收测试门控。若失败,下一步实验是 Gao & Long(SIGMOD 2024,arxiv 2405.12497)的随机旋转预置(ADR-084 也已为 AETHER/频谱图 embedding 标记),需要旋转则大概率产生独立跟进 ADR。
- 非向量数据的 witness-hash 格式(Site 5、7):release bundle 与事件流非原生稠密向量输入。提出的编码——Site 5 的数值 SHA-256 前缀段 + attestation 值、Site 7 的归一化事件类型直方图——合理但未经底层分布漂移验证。若两站点分化,可能出一个形式化"非向量 → 可 sketch"canonical 路径的小型跟进 ADR。
- 跨环境领域泛化交互(ADR-027):Site 1 的每类 sketch 与 Site 4/7 的 per-room bank 隐含是 per-environment 产物;MERIDIAN 在模型层处理跨环境泛化。当 domain detector 报环境漂移时,bank 是重建、交换还是合并?默认是漂移即重建;合并叙事可能更廉价,留待未来 MERIDIAN-aware 部署决策。
- Site 2 的 REST API 形态:在 Qdrant/Pinecone/Weaviate 风格端点(Qdrant 是最接近的 Rust-native 带 HTTP
/points/search比较物)与精简 sketch-only 响应之间,文档有意倾向精简形态。未找到针对"recordings 上的 sketch-only 相似检索"的 Rust-idiom 原始来源;最近模拟物是 SimHash-over-documents 去重,而后者缺少时序录像先例。若出现干净的 Rust crate 拥有该惯用法,Site 2 可能委托而非自研。 - BSSID novelty 与 802.11bf-2025 交互:802.11bf 于 2025 年 3 月发布并标准化 WLAN sensing 测量帧;Site 3 的 novelty sketch 工作在测量层之上(RSSI/SNR/信道时序),不应重复 802.11bf 最终原生暴露的内容。未找到"RSSI-fingerprint anomaly + 802.11bf"原始来源——标注为推测,待客户端/AP 支持到来后重新审视。
关联决策记录
- ADR-027(Proposed)——MERIDIAN 跨环境泛化:per-environment sketch bank(Site 1/4/7)需要 MERIDIAN 检测到域漂移时的显式交换/重建叙事。
- ADR-028(Accepted)——ESP32 capability audit / witness bundle:Site 5 为既有发布产物加 sketch 棘轮。
- ADR-066(Proposed)——Swarm bridge to coordinator:Site 6 在 ADR-066 定义的信道上做路由。
- ADR-073(Proposed)——多频 mesh 扫描:Site 3 的 BSSID novelty 喂给 ADR-073 拥有的跳转调度器。
- ADR-076(Proposed)——CSI 频谱图 embedding:Site 2 的录像检索 sketch 存在时可池化频谱图 embedding,否则回退 AETHER 均值。
- ADR-081(Accepted)——5 层自适应 CSI mesh 固件内核:无固件改动,新 sketch bank 全在集群 Pi 或更上层。
- ADR-082(Accepted)——Pose tracker confirmed-track filter:位于每次 sketch 调用上游,保持不变。
- ADR-083(Proposed)——每集群 Pi 计算跳:Pi 是所有七个新 bank 的主机,其部署叙事是前置条件。
- ADR-084(Proposed)——RaBitQ 相似性传感器(五站点基线):本 ADR 精化并扩展之,未变化处不复述其比较成本 / top-K / 准确率验收数字。
一句话总结 ADR-085 的边界划分:ADR-084 拥有原语,ADR-085 拥有部署表面。 sketch 原语在源码中已被证明与加固,剩下的工程问题是在哪个站点、以什么验收标准把它从"能跑的原语"变成"去掉全量 embedding 的最后一根稻草"。
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0627
Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家(MoE)旗舰模型。模型总参数量 770B,每个 token 激活 49B,主干共包含78层,第一层采用标准 FFN,其余 77 层均为 MoE 结构,每层包含 256 个路由专家与 1 个共享专家,每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP(总参数量 10B,激活 0.7B)以支持投机解码。Python00
GLM-5.3GLM-5.3 与 GLM-5.2 使用相同的基座模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务上的表现显著提升。Jinja00
GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2Jinja00
Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲,涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流,并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00
Spark-X2.5-1.7BSpark-X2.5-1.7B 旨在让强大的 AI 更加实用、高效且易于获取。这些模型在广泛的日常任务中表现出色,涵盖对话、写作、翻译、推理、编程、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合,并支持 200 多种语言。Python00