# 对比图谱是怎么评分的

[对比图谱](/docs/comparison)把二十二张网络，也就是 URnetwork 和那二十一份一对一对比页里的每一个产品，放在两条 0–10 的指数上：横向是**可验证匿名化**，纵向是**连接质量**。本页讲的是方法：这两条指数各自度量什么、哪些产品才会出现在图上的规则、各项权重以及它们为什么是这个数、锚点阶梯如何运作、自评分标准冻结以来每一次改动的带日期记录，以及读者应当拿来衡量这一切的局限。它的意图是：一位怀疑任何一个坐标的读者都能把它重新算出来；而在某个分数属于判断而非有来源的事实时，能看到它被如实标注。

推演过程住在两份附录里。[得分页](/docs/comparison-scores)保存完整矩阵：全部 198 个分项得分、它们所对照的锚点阶梯、每个数字的逐产品推理，以及那些经过披露的重新评分。[敏感性页](/docs/comparison-sensitivity)保存蒙特卡洛记录：在权重与得分不确定性下的排名区间、一对一对比中的次序反转统计、一条被撤回的主张，以及一份可复现脚本。这三者背后的审计轨迹放在文档仓库的 `review/index/` 下：`METHOD.md`（评分标准，在任何产品被评分之前冻结）、`SCORES.md`（可重算的矩阵）和 `NOTES.md`（带引用的逐分推理）。已发布的页面与那份记录保持一致；万一它们不一致，就是其中之一有 bug，而本页末尾说明该去哪里报告。

## 变更台账

一份从不改变的评分对比是陈旧的，而一份悄悄改变的评分对比是没有价值的。以下是自评分标准于 2026-08-07 冻结以来，对方法或对其已发布主张的每一次改动的带日期台账，每一条都标注了它砍向哪一边，因为一位审查自评指数的读者，应当能一眼看出这些更正是不是老往评分者有利的方向落。

| 日期 | 改动 | 方向 |
|---|---|---|
| 2026-08-07 | 评分过程中把 IVPN 的延迟分项归一化 6→7，以与其他所有单跳数据中心 VPN 一致（"冻结"一节下的披露 1） | 对 IVPN 有利；对 URnetwork 中性 |
| 2026-08-07 | 原点由产品负责人从场形心更正为固定的量表中心（披露 2） | 中性；挪动的是线，不是点 |
| 2026-08-07 | Apple Private Relay 在独立同行评审之后被重新评分：E 5→7，S 6→7，X 4.25→5.10（披露 3） | **对我们不利**；更正了一处此前一直有利于 URnetwork 的错误 |
| 2026-08-07 | 那条"没有任何重新加权能把 URnetwork 的 Y 压到 5.00 以下"的主张**因循环论证而被撤回**（记录在[敏感性页](/docs/comparison-sensitivity)） | **对我们不利**；一条关于我们自己的、已发布的稳定性主张被收回 |
| 2026-08-07 | 发布蒙特卡洛排名区间；替换掉原先那种只用单一替代权重的敏感性检验 | **对我们不利**；把一个近乎掷硬币的 X 领先和一个不稳定的 Y 排名都印了出来 |
| 2026-08-07 | 更正 URnetwork 的 S 推理：对照当前服务器源码核实后，去掉那条过时的"注册 IP 以原始形式保留 180 天"扣分；分数按阶梯重新推导，**仍为 8 分不变** | 意图上对我们有利，但没有影响分数；标注出来是因为这是往好听方向走的那一边 |
| 2026-08-07 | 发布对比对象选取规则；点名两个符合条件但我们尚未对比的产品 | **对我们不利**；记录了我们自己的遗漏 |
| 2026-08-07 | 更正整套语料里反复出现的"URnetwork 没有独立审计"：存在两项第三方评估，一次是对 Web 应用和 API 的第三方渗透测试（2025 年 4–5 月），一次是对 Android 应用的 Leviathan Security Group MASA AL2 评估并通过（2025 年 5 月）。两者都不覆盖协议、连接引擎或运营方的服务器代码。V 按阶梯重新推导，**仍为 6 分不变** | **对我们有利**；这份文档在大约三十处把我们说低了，而报告由产品负责人提供。标注出来是因为这是往好听方向走的那一边，也正因如此，它被定价为零 |
| 2026-08-07 | **Obscura 被评分并加入**，成为第二十一个被对比的产品，依选取门槛 (d) 作为架构上最接近的竞争对手进入，而正是这处遗漏被同行评审用来证明旧的临时选取方式已经失效。它严格按冻结的阶梯评分；没有动过任何其他产品的分项得分。它落在 (6.60, 5.10)：X 轴第四，比当时评分下的 URnetwork 落后 0.25，并且正好在 Y 线上（+0.10，处于噪声之内）。所有排名区间当天在 22 个产品的场上重算 | **对我们不利**；它把一个竞争对手安置在我们旁边的右上格里，而按当时的评分，它在结构分项上超过 URnetwork（E+S 合计 16 对 15；它始终开启的入口盲视胜过我们当时的自选开启），在 V 上与我们打平，只在后量子上落后；在 ±1 得分噪声下，URnetwork 保住 X 领先的比例仅为 69.5%，而这一切都是印出来的，不是抹平的 |
| 2026-08-07 | **URnetwork 被重新评分：密封会话在发布时默认开启。**产品负责人的一次裁定（记录在工作记录的流程速记本和 `verify/BEFORELAUNCH.md` 第 7 项里）推翻了 URnetwork 四个 X 分项中有三个所依据的"自选开启"设定。按未改动的冻结阶梯重新推导：E 7→8（默认开启的结构性运营方盲视取该分段的顶端，与把 Obscura 的始终开启定为 8 分是同一种读法；浏览器扩展仍然没有密封会话，而密封在发布前尚存的两处完整性缺陷，静默的失效开放（fail-open）和一把可被运营方替换的提供者密钥，被作为 9–10 分的门槛印在分数旁边，而不是被豁免），PQ 5→7（默认开启的旗舰级梯级，取其下限），S 重新推导后**仍为 8 分不变**（9–10 梯级仍然在"构造上的多方"和"无可识别身份的账户"两点上不达标），V 未动，仍为 6 分。X 6.85→**7.30**；Y 不受影响。排名区间和每一项一对一敏感性都在当天于整个场上重算 | **对我们有利**；这是 2026-08-07 处理的第三条对我们有利的更正，也是第一条真正挪动了数字的。前两条（从 S 中划掉的那条过时的原始 IP 留存扣分，以及 V 上的审计记录更正）走的是同一套阶梯重新推导，并且正确地什么都没产生，这正是这套纪律确有咬合力、而不是装饰的证据。这一条之所以挪动，是因为它是产品负责人裁定的一次真实能力变更，而不是一条过时的扣分；而那些为它降温的完整性注意事项，与分数一起被印了出来 |

没有改变的东西：没有任何权重、没有任何锚点，也没有任何分项得分被改动，除了那两次经过披露的重新评分，即 Apple Private Relay 的那次，以及 URnetwork 在自家密封会话转为默认开启时的那次。

这份台账所处的长期结论来自同行评审：这个指数"透明但未经验证"。透明正是本页一直在卖的东西：每一项权重、每一个锚点、每一个分项得分都公开，好让持不同意见的读者重新计算。而第一位真正动手重算的认真读者，找出了一条循环论证的稳健性主张和一处足以改变分类的事实错误。透明不等于有效。这个指数仍然是一次带着已声明利益冲突的单一评分者活动，它把序数判断当作等距测量来聚合，也没有对照任何关于 URnetwork 的外部测量做过验证。没有独立审计覆盖 URnetwork 的协议、它的连接引擎或运营方的服务器代码，而那正是整个论证所依托的那一层。（确实存在两项第三方评估，覆盖的是其他层面：2025 年 4–5 月对 Web 应用和 API 的第三方渗透测试，以及 2025 年 5 月完成的、在 Google 的 App Defense Alliance MASA 计划下由 Leviathan Security Group 对 Android 应用所做的保障级别 AL2 评估，结果通过，而 Leviathan 自己界定它不是一次整体性的安全评估。两者都没有检查日志、留存或数据路径。）能抬高这个指数地位的东西是已知的，而其中没有一样是写作本身：带公开评分者间一致性的独立评分者、一次外部测量行动、一次对协议和服务器的审计。在那之前，请把这张地图读作我们把自己的论证做成了可核查的样子，而不是读作一次测量。

## 这两条指数度量什么

**X，可验证匿名化。**整套语料的第一个问题：这项服务能看到你的什么，你又如何得知？这条轴奖励两样东西，而且刻意按这个次序。*结构*：一种没有任何单独一方能同时握有你的身份和你的活动、也读不了你传输中流量的设计。以及*验证*：那些让外部人得以核查这项主张的证据，也就是开源、独立审计、法庭与搜查的结果，以及外部测量。地图上的象限名称说的是同一个区分：线的右边，"什么都看不到"这个主张是可以核查的；线的左边，无论运营者的行为多么良好，这个主张都建立在信任之上。

**Y，连接质量。**第二个问题：这条连接好不好到可以长住其上？延迟和吞吐的档次、出口是否真的交付它所宣称的位置、在网络充满敌意时有多少条进入的路，以及你到底能不能拿到并保住这项服务。

**为什么是这些分项而不是别的。**X 的这些分项，是直接关乎"谁能看到、你又如何得知"的那四项性质；别的任何东西都会用代理指标稀释这条轴。管辖权和所有权，也就是 VPN 营销惯用的那套速记，是被刻意排除的：它们是关于未来行为的先验，不是系统的可验证性质，而且它们抗拒 0–10 的锚定（逐个产品的页面以散文形式承载它们，并点名日期和东家）。只用内存的机队、断网保护和应用的打磨程度同样是真实的，但它们属于产品评测，不属于一条匿名化指数。在 Y 上，价格和设备数量限制被排除，因为它们是购买因素，不是连接的性质；种子下载政策和端口转发只在它们属于出网限制时才出现，而其中第一项让 URnetwork 在[得分页](/docs/comparison-scores)上损失了几分之一分。两条轴装不下一切，这两条也不去尝试。

## 哪些产品会出现在图上：选取规则

最初那二十个对比对象是临时挑的，依据是市场份额加上想覆盖每一个架构类别的愿望，而且没有公开任何纳入规则。独立同行评审指出了这一点，并提供了它为什么要紧的证明：Obscura，架构上与 URnetwork 最接近的竞争对手，一直缺席，直到一位评审点了它的名。"我们注意到了它"不是一种方法。下面这条规则存在的意义是：下一次遗漏将是一次任何人都能指出来的规则失效，而不是一次谁也无法检视的判断。

**一个产品同时满足以下三个条件才算合格：**

1. **它是一项有人运营的中介服务。**一项普通消费者今天就能拿到的、已发布的服务，其核心功能是为了隐私、匿名或改变位置，在用户与目的地之间放置一个有人运营的中介：商业 VPN、平台中继、洋葱网络和混合网络、dVPN、代理网络。用户自己就是运营者的自托管软件（一台裸的 WireGuard 服务器、Outline）不在范围内。那里根本不存在一个可见性成问题的第二方，而那正是两条轴所评分的问题。
2. **它至少跨过四条覆盖面或相关性门槛中的一条：**
   - **(a) 采用度**：在当前带日期的公开市场数据中，按安装量或市场份额位居消费级 VPN 采用度的第一梯队；
   - **(b) 原型旗舰**：某个独立架构类别的旗舰或采用最广的实现（洋葱路由：Tor；混合网络：NymVPN；平台中继：Apple Private Relay；边缘中继：Cloudflare WARP；网状覆盖网：Tailscale；dVPN 市场：Orchid、Mysterium、Sentinel；住宅 P2P 代理：Hola）；
   - **(c) 评估方推荐**：某家主要独立隐私评估机构的当前推荐。这是 IVPN 依以进入的门槛：它的市场份额小众，但独立评估方因为它的验证记录而单独点出它，而那恰恰是 X 轴所评分的东西；
   - **(d) 架构竞争对手**：一项与 URnetwork 自己的招牌主张可比的信任分割或"没有任何单独一方"主张。这是 Obscura 依以进入的门槛，也是每一次评审或读者提名首先要对照检验的门槛。
3. **它是可评分的。**存在足够的公开证据，散布在文档、审计、测量和政策里，足以对照冻结的阶梯给出全部九个分项得分。一个在覆盖面上合格、却无法从那些证据评分的产品，会被列为待定，而不是凭印象打分。

**排除项：**已停产或买不到的产品（Google One VPN）；个人无法购买的纯企业级产品；已被纳入的技术栈的白牌换标（Betternet 不评分，因为 Hotspot Shield 已经代表了 Hydra 技术栈）；以及按条件 1 排除的自托管工具。

**这个集合怎样被重新审视。**这份合格性清单会在每一次语料修订时、并且至少每六个月，对照带日期的市场数据重跑一遍。周期外的触发条件，任何一条都会强制立即检查：某个产品发布了"没有任何单独一方"的设计（门槛 d）；某个产品跨过了采用度门槛；某位评审或读者点了一个候选者的名。无论候选者是否通过，提名、日期和结果都会被记录下来，Obscura 的进入正是这样被记录的。停止发布的产品会连同它最后一次被评分的日期一起归档，绝不悄悄移除。

**把这条规则用在当前集合上（2026-08-07）。**全部二十二个成员都合格：Windscribe、PIA、ExpressVPN、Proton VPN、NordVPN、Surfshark、TunnelBear、IPVanish、Hotspot Shield 和 Hola 依 (a)；Tor、NymVPN、Apple Private Relay、Cloudflare WARP、Tailscale、Orchid、Mysterium 和 Sentinel 依 (b)；IVPN 依 (c)；Mullvad 依 (a) 和 (c)；URnetwork 和 Obscura 依 (d)，后者于 2026-08-07 被评分，也就是它的对比页发布的同一天。有一个边缘情形是被点名而不是被含糊带过的：Orchid 是最接近"已停产"这条排除项的成员（它的移动应用已经过时好几年），在它已发布的客户端仍能工作期间留下，而它也是重新审视规则最先会归档的那一行。

**这条规则说我们缺了什么。**一条从不点名缺口的选取规则只是装饰。今天套用同样的门槛，点出了两个这套语料没有对比的产品：

- **CyberGhost** 干脆利落地跨过 (a)：按其自称的用户数量，它属于最大的消费级 VPN 品牌之列，而我们自己的证据基础已经把它测量在内（出网得分背后的 IPinfo 位置研究包含 CyberGhost，评分笔记也引用了它的结果）。在每一个同量级的大品牌都在场的情况下，它的缺席没有任何有原则的理由。
- **Psiphon** 依 (b) 跨过门槛，它是 Tor 之外部署最广的专门翻越审查服务，在全国性封锁事件期间有据可查的大规模采用。Y 轴上可用性与抗审查那一分项正是它的主场，这让这处遗漏更糟，而不是更轻。

两者都被记为选取欠账：它们合格，而在它们的页面和分数出现之前，这张地图的场按它自己已发布的规则就是不完整的。

## 权重，以及理由

每条指数都是它各分项的加权和；每条轴的权重之和为 1.00。

### X：可验证匿名化指数

| 分项 | 权重 | 为什么是这个权重 |
|---|---|---|
| **S**，身份与活动的分离 | 0.35 | 匿名化的核心：是否存在某个单独一方同时握有你是谁和你在做什么，包括使用这项服务所需的账户与支付身份？如果一方两者都握着，其余的一切都只是缓解措施，所以这是最重的一项。 |
| **V**，"无日志"是可验证的而不是被承诺的 | 0.30 | 这条轴的名字就是*可验证*。开源、独立审计、法庭与搜查证据，以及外部测量都会挪动这个分数；一句光秃秃的承诺无论说得多诚恳，都停在接近零的地方。 |
| **E**，穿过这项服务的端到端加密 | 0.25 | 运营者是在结构上无法读取你的流量，还是仅仅承诺不去读。加密*到*一家会把一切解密的公司那里，不是穿过*它*的加密。仅次于分离，因为它是"看不到"这件事的另一半结构。 |
| **PQ**，后量子加密 | 0.10 | 密钥交换是否抵抗先收割后解密的攻击。这是一项真实的、面向未来的区分点，但对当下的匿名性还不具决定性，因此权重最小。 |

这些数字里刻意采取的立场：结构（S + E = 0.60）压过验证（V = 0.30），理由是结构正是验证之所以存在、要去核查的那个东西。一句被审计过的承诺仍然是承诺，而一种取消了"看见"这一能力的设计，需要被信任的地方更少。一位把证据记录看得比架构更重的读者，会把这条轴的顶端重新排序，而[敏感性页](/docs/comparison-sensitivity)把那个替代方案完整推演了一遍，而不是把它藏起来。

### Y：连接质量指数

| 分项 | 权重 | 为什么是这个权重 |
|---|---|---|
| **L**，延迟 | 0.30 | 一条连接上用户最能感知的性质，也是最由架构决定的那一项：跳数、路径长度、边缘远近。按结构类别评分；这里没有任何产品发布过本语料接受的延迟数字，所以这套评分里任何地方都没有毫秒数。 |
| **T**，速度 / 吞吐 | 0.25 | 感知度第二。同样是结构性的（数据中心单跳、受住宅带宽限制、中继链条），再加上各厂商自己发布的定位。整套语料里唯一的吞吐数字来自 URnetwork 自己，并署名给 URnetwork：40 Mbps+ 平均流媒体速度。 |
| **Eg**，出网质量 | 0.20 | 出口是否交付它所宣称的东西：实测的位置真实性（IPinfo 研究）、被标为托管的地址空间还是住宅地址空间，以及你能把露面的地点选得多细。排在第三位，因为一条通往被封锁的、或者不在所宣称位置上的出口的快隧道，对选择它的那个人来说并不是一条能用的连接。 |
| **A**，可用性 / 抗审查 | 0.15 | 你能不能拿到它、并让它一直可用：免费入口、平台广度、在网络充满敌意处的表现，以及区域性撤出。 |
| **In**，进入方式 | 0.10 | 进入的路：协议、混淆传输、志愿者入口路径。权重最低，因为它对一部分用户极其要紧，对大多数人则完全不要紧。 |

### 冻结

权重和锚点阶梯于 2026-08-07 被写下并冻结，**在任何产品被评分之前**，此后未做调整。这是一位怀疑者应当首先检验的事，而带日期的冻结评分标准文本就放在仓库的 `review/index/METHOD.md`。这份评分标准还以书面形式预先承诺了那些最容易让人想放软的结果：URnetwork 的可验证性分数必须因为没有第三方审计而被扣分；它的密封会话必须按当时的自选开启来评分；而 Mullvad、IVPN、Tor 和 NymVPN 依证据所示得分，哪怕这会把它们在某个分项上放到 URnetwork 之上，或者，对 Mullvad 和 IVPN 而言，放进同一个象限。其中第一条的冻结措辞照原样留着，而它在事实上是错的，且是往对我们不利的方向错：当时确实存在两项第三方评估（见上面台账的那一行，以及[得分页](/docs/comparison-scores)上的 V 推理）。它所要求的扣分仍然适用，因为两项评估都没有触及这条轴所度量的那一层，而分数是被重新推导的，不是被调整的。第二条预先承诺的终结靠的是裁定，而不是错误：2026-08-07，产品负责人裁定密封会话在发布时默认开启，所以那个"自选开启"的前提描述的是产品已经离开的状态。受影响的分项得分是按未改动的锚点重新推导的，不是被调整的；台账带着方向记下了这次改动，而冻结文本再一次照原样留着。

评分开始之后确实有四件事改变了，而且全部被公开，而不是抹平：

1. **评分过程中有一个分项被归一化。**IVPN 的延迟分项一开始因为它较小的机队而被打了 6 分，随后被归一化为 7，以与其他所有单跳数据中心 VPN 一致。本语料没有记录任何逐厂商的延迟劣势，而在没有测量的情况下因为机队规模就扣一家的分，那会是凭空捏造的精度。工作记录保留了原始数值，而 IVPN 在[得分页](/docs/comparison-scores)上的条目会把两种情况下的效果都印出来。
2. **原点定义在评分之后被更正**，由产品负责人做出，而它是评分之后对方法的唯一一次改动。下一节解释它。
3. **Apple Private Relay 在独立同行评审之后被重新评分**，就在首次评分的同一天：证据基础本身，以及建立在它之上的每一个页面，都把 Apple 的分割错误描述为由合同维持，而 Apple 自己的概述描述的是由分层加密来执行。对照未改动的冻结锚点，E 5→7 和 S 6→7，X 4.25→5.10，这把 Apple 从传统象限挪到了 X 线本身上。那处错误此前一直有利于 URnetwork，而那正是我们最需要抓住的方向；没有动过任何其他产品的分数。完整的重新推导在[得分页](/docs/comparison-scores)上 Apple 的条目里。
4. **URnetwork 在产品负责人裁定其密封会话于发布时默认开启之后被重新评分**：这是评分之后的第二次重新评分，也是挪动我们自己那个点的那一次。对照未改动的冻结锚点，E 7→8 和 PQ 5→7，S 重新推导后仍为 8 分不变，V 未动仍为 6 分；X 6.85→7.30。[得分页](/docs/comparison-scores)上 URnetwork 条目里的重新推导，包含了那条明确的裁定，即加密阶梯更高的那一级要求默认开启、但尚不要求完整的完整性，并把密封仍然存在的失效开放与密钥替换缺陷印在分数旁边，而不是豁免它们。

这四条是分数层面和原点层面的改动。完整的带日期台账，包括评审之后的方法改动及各自砍向哪一边，在本页靠上的位置。

## 两轴为什么交叉于 (5, 5)

两轴交叉于 **(5.00, 5.00)，即 0–10 量表的固定中心**。因此一个位置相对于评分标准的锚点是绝对的：越过一条轴线就意味着越过量表的中点，无论场上其余的产品是什么样子。

评分标准的第一稿对原点的定义不同，把它定为场中间部分的形心（每条轴上中间十一个产品的均值，按这些分数算出来是 (3.81, 5.66)）。那个定义在评分之后被替换掉了，因为一个形心原点是相对于恰好在图上的那些产品而言的：加进三个弱产品，其他每一个产品都会在自身毫无变化的情况下向右越过象限线。一个固定的量表中心在场发生任何变化时都保持稳定，并且让读者不必知道还有谁被评分过，就能对一个位置做推理。这次更正只改变了两条轴线交叉的位置，因而也改变了某些产品所带的象限名称；没有任何权重、锚点或分项得分随之改动，此后也没有任何东西被重新评分。两种原点定义和更正日期都保存在工作记录里。

有一条阅读规则从算术里直接推出来。因为分项得分是整数，一个中等权重分项上的一分变化会让指数挪动约 0.25，这正是为什么在这些页面里，落在距某条轴线 ±0.25 以内的产品，都被读作坐在线上，而不是有把握地落在它的某一侧。哪些产品落在那条带子里，与坐标一起列表在[得分页](/docs/comparison-scores)上，而单点重新评分会挪动什么，在[敏感性页](/docs/comparison-sensitivity)上被完整推演。

## 量表：锚点阶梯如何运作

每一个分项得分都是 0–10 的整数，对照一份在任何产品被评分之前就写好的锚点阶梯给出：一张梯级表，为每一个分数段点名它所代表的设计或证据类别。一个落在两级之间的整数，意味着该产品处在那两个类别之间。作为贯穿全部九个分项的校准：**2** 分左右意味着这项性质基本不存在，或者只以文字形式存在；**5** 分左右意味着它存在但只是部分、有边界，或者由合同与政策而非结构维持；**9** 分左右意味着它由构造而来、默认开启，并带着场上最强的证据。九份阶梯连同矩阵完整印在[得分页](/docs/comparison-scores)上，而冻结的原件放在 `review/index/METHOD.md`。

## 那些局限

这是本页里为其余部分挣得分量的那一节，所以其中没有一句被放软。

1. **这些是对已公开证据的评分，不是测量。**输入是那二十一份对比页、各厂商自己的披露页面、审计与法庭记录，以及 IPinfo 的测量研究。凡是存在外部测量的地方，它就挪动了分数；出网那一列直接倚在 IPinfo 的结果上。地图上每一个延迟和吞吐分数都是结构类别判断，因为本语料禁止凭空捏造的性能数字。一次真正的测量行动可能会把质量轴的中段重新排序，而本页上的任何东西都不应被误认为是那样一次行动。
2. **没有人从外部测量过 URnetwork。**IPinfo 测出 Mullvad、IVPN 和 Windscribe 的位置不符为 0%；对 URnetwork 的出口、延迟或吞吐，任何方向上都没有跑过等价的研究。它的 Eg 8 分建立在一套你可以在代码里查证的机制上，以及住宅地址空间的结构性性质上，而不是建立在某个第三方结果上；而它的 L 5 分和 T 5 分是未经测量的结构锚点。这里写明这种不对称，是因为它砍向的正是这套文档所属的那个产品。
3. **没有独立审计覆盖 URnetwork 的协议、连接引擎或服务器代码，而这条轴的名字就是*可验证*。**这份缺席已被计入价格，V 6 分对 Mullvad 的 9 分、IVPN 的 8 分和 PIA 的 8 分，而它也是本语料所记录的、对 URnetwork 最大的一条批评：全栈开源是对设计的持续可验证性，但对这项主张所依托的那一层没有独立核查、没有法庭检验、也没有外部测量，这在一项关于可验证性的主张里是一个真实的窟窿，而且它在那条承载着这个产品象限名称的轴上要花掉真实的分数。确实存在的那两项第三方评估覆盖的是其他层面，什么也没挪动；上面的台账和[得分页](/docs/comparison-scores)上的 V 推理承载着它们。直到 2026-08-07，本语料还平铺直叙地说一项都没有；那是错的，而更正它改变的是那句话，不是那个分数。
4. **关于默认设置与能力的一条规则，双向适用，其输入被一次裁定更新过一回。**这条规则是：一个产品按它已发布的默认状态评分，而一项自选开启的招牌能力被记作条件性结构，不记作默认。在它之下，URnetwork 当时自选开启的密封会话得 E 7 分，而 NymVPN 自选开启的混合网络把它的 E 保持在 9 分而不是 10 分。当产品负责人裁定 URnetwork 的会话在发布时默认开启时（2026-08-07，已在台账中披露），同一条规则把 URnetwork 挪到了 E 8 分。改变的是事实，不是规则，而 Nym 的混合网络仍被记作它至今仍然是的那种自选开启能力。一位只按已发布默认状态评分的读者，仍然应该调低 Nym 的 E；一位只按能力评分的读者，则应该调高它。站不住脚的是只做其中一件而不做另一件。
5. **有些位置落在噪声之内，有些排序是加权判断。**Apple Private Relay 同时落在两条轴线的噪声之内；Obscura 坐在质量线上；Mysterium、Hola 和 Sentinel 落在它下方的噪声之内；而站得住脚的重新加权会把 X 轴的顶端重新排序，包括排到对 URnetwork 不利的方向。点名的清单、单点算术，以及推演过的重新加权，都在[敏感性页](/docs/comparison-sensitivity)上，与它们所属的蒙特卡洛记录并列。
6. **评分者存在利益冲突。**是 URnetwork 给这个场评的分，而 URnetwork 就在地图上。缓解措施就是本页及其附录里的那些：权重和锚点在评分之前冻结、每个分项得分连同它的推理一起公开、判断性的结论被如实标注、那种把 URnetwork 降位的重新加权被印出来而不是埋起来。它们没有一样能替代一位外部评分者。这份矩阵被刻意做得足够完整，好让你可以成为那位评分者：改动权重，或者任何一个你能从证据出发论证的分项得分，这张地图就归你重画。

## 如果这幅图景改变

如果有新证据落地，一次对 URnetwork 协议或运营方服务器代码的独立审计、一次对它网络的外部测量，或者一个发布了可验证结构性分离的竞争对手，那么长期规则就是重新评分并重新发布，按这个顺序，而上面的台账会多出一行，并标注它的方向。如果本页或其附录上的某个数字算不回来，或者某个页面与 `review/index/` 里的工作记录发生漂移，请把它当作任何其他文档 bug 一样报告：在代码仓库上提 issue（github.com/urnetwork），或在应用内提交反馈。
