Zero-Shot Transfer Results: Is the Render Upgrade Friend or Foe, Part 2
口径是先平均、后相减:每条路线在每一侧先对三个种子批取均值,再对两侧均值做差
为路线数。先配对再做差的意义:同一条路线在两侧共享几何与难度,差值把路线间的异质性消掉,只留下”换世界”的效应。汇总值出自 EXP-T3.5-cp3 的 summary.json,路线级配对表在 EXP-T3.3/T3.4 的 metrics.json,每个数可溯源复算。
| 路线 | UE4 | UE5 | Δ | 路线 | UE4 | UE5 | Δ |
|---|---|---|---|---|---|---|---|
| 10000 | 74.7 | 33.6 | −41.1 | 10008 | 2.9 | 86.7 | +83.7 |
| 10001 | 4.9 | 33.6 | +28.7 | 10009 | 25.4 | 53.5 | +28.0 |
| 10002 | 27.2 | 53.5 | +26.3 | 10010 | 51.6 | 33.3 | −18.3 |
| 10007 | 83.1 | 100.0 | +16.9 | 10011 | 82.8 | 100.0 | +17.2 |
| 10016 | 44.4 | 69.3 | +24.9 | 10017 | 98.8 | 0.2 | −98.6 |
七正三负。正向七条里六条在 +16.9 到 +28.7 之间缓涨,一条 +83.7 是差生逆袭;负向三条是 −18.3、−41.1、−98.6 的断崖。十条相加约 +67.7,均值 +6.76(末位差异来自路线均值的舍入)——温和的均值是从撕裂的分布里平均出来的。
这是聚合统计的经典陷阱(与辛普森悖论同源):当效应在不同单元上方向相反时,均值描述的是任何一条路线都不具有的”平均体验”。对闭环迁移研究,路线级的真实问题是”新世界对哪类路线是毒药、对哪类是解药”,均值对此不携带任何信息。这也是 M3 复盘里定下的方法论:SimLingo 噪声由行为翻转主导,一切收益评估必须逐路线配对,不能只看总均值。
SimLingo UE5 侧四个批次均分(EXP-T3.3 metrics.json):
| 批次 | s0 | s1 | s2 | s0r(同种子重跑) |
|---|---|---|---|---|
| meanDS | 40.89 | 50.17 | 78.00 | 60.00 |
批与批最大相差 分,而待检验的迁移信号只有 +6.76——信号完全泡在噪声带里。更刺眼的是同种子对:s0 与 s0r 理论上是同一实验,实测差 19.11 分;逐路线看,10000 重跑差 99.7、10001 差 99.6(一次超时、一次满分),其余八条 。
闭环驾驶是动力学系统:第 帧的决策改变第 帧的观测,微小差异沿时间指数放大(混沌系统的初值敏感性)。模型在某个路口的一次微小犹豫,可能分叉成”顺利通过”与”卡死超时”两种结局——DS 因此呈二元翻转而非连续抖动。这解释了为什么噪声分布不是高斯的:它是”少数路线的 0/100 翻转 + 多数路线的近乎零扰动”的混合。
对比 AutoMoT:同一套 UE5 管线,重跑逐路线零差异。仿真器与评测链对两个模型是同一套,噪声量级却天差地别——说明噪声主要来自模型自身行为对扰动的放大系数,而非测量装置。
AutoMoT 十条路线的配对差值(EXP-T3.4 metrics.json):
| 路线 | UE4 | UE5 | Δ | 路线 | UE4 | UE5 | Δ |
|---|---|---|---|---|---|---|---|
| 10000 | 100.0 | 100.0 | 0.0 | 10009 | 34.0 | 100.0 | +66.0 |
| 10001 | 42.6 | 100.0 | +57.4 | 10010 | 70.0 | 100.0 | +30.0 |
| 10002 | 47.2 | 100.0 | +52.8 | 10011 | 100.0 | 100.0 | 0.0 |
| 10007 | 100.0 | 100.0 | 0.0 | 10016 | 74.2 | 100.0 | +25.8 |
| 10008 | 2.9 | 100.0 | +97.1 | 10017 | 100.0 | 100.0 | 0.0 |
四条 UE4 已满分 → UE5 保持满分(“平”);六条失败或部分完成 → 全部拉满(“升”)。无一变差。均值从 67.10 到 100.00。
DS 定义在 上。当模型在 UE4 侧已有 4/10 路线顶到上界,这些路线的 被结构上锁死为 0——不是”新世界没帮到它们”,而是指标没有空间表达”更好”。这就是天花板效应(ceiling effect):测量工具在高分段失去分辨力。
天花板效应在本数据里有两个可辨别的后果:
SimLingo 的 UE4 基线 49.59 远离天花板,十条路线双向自由运动,于是测得七正三负的撕裂分布。两个模型的路线级画风差异(六升四平 vs 七正三负)有真实成分(强模型行为更稳),也有指标结构成分(天花板 vs 开阔区间)——解读时必须把两者分开。
UE5 的 Lumen 全局光照(Global Illumination)逐帧求解间接光的弹射,车道线、路沿、障碍物轮廓的明暗对比不再依赖手工摆放的烘焙光,边界更锐。对依赖边缘与区域分割的场景理解(车道在哪、可行驶区域到哪为止),锐边界直接降低感知歧义——模型不必再对模糊区域”脑补”。
PBR 材质与更真实的反射让渲染画面的纹理统计更接近真实交通场景。VLM 主干(SimLingo 的 InternVL2-1B、AutoMoT 的 Qwen3-VL)都在海量真实照片上预训练——画面越像真实世界,预训练特征就越直接可用,仿真到模型的”最后一公里”变短。注意这给出一个反直觉推论:UE5 对 VLM 的域差距可能比 UE4 更小,哪怕对”在 UE4 上训练的驾驶头”而言它是新分布。
全局光照让明暗过渡在时间和空间上都更平滑(少硬阴影、少突变高光),逐帧输入画面的特征变化更连贯。对逐帧独立推理的 VLM agent,帧间特征稳定意味着输出动作的抖动减少——闭环里抖动少,就不容易在路口犹豫到超时。
KID 这类分布距离是无方向的标量:它说两个分布相距 0.0743,不说这个位移是”远离真实”还是”朝向真实”。如果 UE4→UE5 的位移方向恰好朝向 VLM 预训练分布,那么统计距离很大的迁移也可以是净收益。这解释了本实验的核心反差:KID 是域内基线的约 700 倍(距离真实存在且很大),zero-shot 分数却不降反升(方向有利)。只看距离大小预测迁移成败,是 sim-to-real 文献里最常见的误判之一。
HiDrive(arXiv 2605.09972,2026-05)是基于 CARLA 的 UE5 分支搭建的闭环评测 benchmark,主打长尾场景(long-tail scenarios)与法规/伦理维度指标,代码资产开放。它是”UE5 上做闭环评测”的公开先例,本项目的 UE5 侧自建基建(路线执行器、DS/SR 评分)在设计时直接参考了它。
HiDrive 同样测过 SimLingo 类模型在 UE5 渲染下的表现,观察到的是掉分——与本实验”方向为正、未观察到掉分”相反。同一引擎世代、同一族模型,两份报告的箭头指向相反。
遇到文献与自己结果冲突,排查顺序是:
本例落在第 3 种:HiDrive 的掉分在其自建协议(更长路线、长尾场景触发器)上观察,本实验的提升在受控对齐短路线集上观察。两份结果刻画的是同一个模型在不同考试下的两张成绩单。
HiDrive 的存在同时证明了两件事的可行性:CARLA 0.10 的 UE5 分支可以支撑严肃闭环评测(基建路线可行),以及 UE5 迁移的结论对口径高度敏感(必须在报告里把口径写死在结论旁边)。前者是工程先例,后者是方法论警示。
| 口径维度 | 本实验(MySim 对齐集) | HiDrive 协议 |
|---|---|---|
| 路线长度 | 百米级短路线 | 更长路线 |
| 场景构成 | 常规驾驶,无触发器 | 长尾场景触发器 |
| 光照天气 | 白天锁死、单 Town10 | 更多条件组合 |
| 背景交通 | 低密度受控(瞬时约 6–7 辆) | 依 benchmark 设定 |
| 失败模式构成 | 卡死/超时/偏航为主 | 长尾交互失败有登场机会 |
闭环评测的结论本质是失败模式的统计:模型在哪些地方、以什么方式失败,决定了均分。而失败模式的登场与否由口径决定:
模型在短路线上”没机会暴露”的弱点,在长路线+长尾的卷子上会成为主失分项。同一份权重,两张卷子,两个方向——各自对自己的口径负责,互不否定。
对照实验的报告规范由此推出:结论必须与口径绑定引用。写”SimLingo 在 UE5 上不掉分”而不附”十条百米级短路线、白天锁死、低密度交通”的口径,等于把一个条件命题偷换成全称命题。这也是 CP5 报告把结论定性为”受控对齐条件下的存在性案例证据”的原因。
“渲染升级不伤反助”成立的全部范围是:十条百米级对齐短路线、单 Town10 地图、白天锁死、低密度受控交通、两个指定模型的官方权重。超出其中任何一条——换路线类型、换光照、换城镇、换模型——结论都不自动延伸。
CP5 报告的原文口径是:“结论限受控对齐条件下的存在性案例证据”。
存在性证据(existence proof)回答的是”有没有可能”,不是”普遍怎样”。本实验证伪的是强形式的悲观命题——“UE5 渲染域差距必然导致 zero-shot 掉分”:只需一个受控场景下不掉分的反例,该命题即被推翻。但它不能证实其逆命题”UE5 渲染普遍无害”,那需要在路线、光照、交通、模型的全空间上采样,成本是另一量级。
两类命题的证据要求不对称:
外部效度(external validity)指结论推广到实验情境之外的程度。本设计为内部效度(变量归因的干净程度)付出了外部效度的代价:路线收缩(20→10)、白天锁死、低密度交通,每一项都在收窄结论的合法外推范围。这不是缺陷而是取舍——先在小口径内把因果钉死,再谈扩张;CP3 报告里也留了扩容预案(UE5 侧补跑 10 条路线约 6h GPU,恢复 20 条口径以压缩 MDE)。
引用这类结果时的自检清单:路线范围、光照条件、交通密度、模型与权重版本,四个限定词缺一个,严谨的结论就退化成吹牛。
UE4→UE5 的差异是复合的:渲染管线(Lumen/Nanite)之外,物理引擎从 PhysX 换成 Chaos,地图整体重制,三者捆绑交付、无法单独开关。zero-shot 分数变化因此不能默认记在渲染头上。要支持”渲染域差距驱动了分数变化”,至少应观察到:渲染差异越大的路线,分数变化越大。这可以检验。
对每条路线 取两个量:
计算两者的 Spearman 等级相关系数
是路线 在两个变量上的名次差,。Spearman 只依赖排序不依赖数值,对 DS 这种有界、含翻转的变量比 Pearson 稳健。 值给出”无真实相关时观察到该 的概率”, 下检验力本就有限,结论按探索性口径报告。
| 模型 | Spearman | 解读 | |
|---|---|---|---|
| SimLingo | −0.382 | 0.276 | 方向符合直觉(渲染差异越大提升越小),但不显著 |
| AutoMoT | −0.044 | 0.904 | 近零相关,提升由非渲染因素主导 |
均不显著:渲染归因的间接证据链不成立。深层原因在数据本身——没有路线级掉分可归因:SimLingo 的 Δ 均值 +6.76 泡在 20.74 的噪声带里,AutoMoT 的 Δ 则整齐划一地冲向天花板。统计检验不能从没有方差结构的数据里挤出归因。
CP5 的落法是:“zero-shot 变化不能全归因渲染(KID 相关性亦未支持);结论限受控对齐条件下的存在性案例证据。“注意措辞是”未获得支持归因的证据”,而非”证明了提升与渲染无关”—— 的探索性检验同样没有证伪的能力。证据的缺席不等于缺席的证据。