留言

用可执行代码建模物理世界:从观测回推机制

生成逼真的影像或构建复杂的三维场景,并不等同于真正理解世界。当前的模型可以预测像素如何变化、生成看起来合理的视频,或重建几何结构,但这些都只是表象。要达到物理智能,系统需要回答更深层的问题:世界由哪些实体构成、这些实体处于何种状态、以及哪些规则驱动它们的演化?换言之,AI 的下一步不是仅描述“会看到什么”,而是恢复“为什么会这样发生”。

Code-as-World 的核心思想是把对现实的观察主动转化为一段可执行的代码:把对象、状态、物理参数和动力学规则显式写入,使对世界的解释成为可运行、可查询、可干预并可被验证的“世界假设”。与仅追求视觉上相似的像素预测不同,这种表示优先保持世界组成与演化机制的一致性,从而支持更强的归纳和迁移能力。

要用代码表达一个物理场景,通常需要三类信息:一是组成(Composition)——有哪些物体、它们的几何形状和物理属性(质量、摩擦等);二是演化(Evolution)——物体如何随时间运动、相互作用以及关键事件的触发条件;三是观测方式(Appearance)——相机参数、光照、材质等决定了世界如何被记录为图像。将这三部分结合起来,得到的不是简单的场景图或轨迹记录,而是一个可以被模拟、修改并重新执行的完整世界模型。 球友会

此外,Code-as-World 并非一次性地从观测直接生成最终代码,而是构建为一个带有试探、模拟与验证循环的发现过程:智能体基于当前证据提出候选世界假设,用物理引擎或模拟运行这些假设,检验它们是否能解释观测,并在必要时调整假设继续迭代。这种闭环类似科学中的溯因推理,能在噪声和不完备观测下逐步逼近最优且简洁的解释。

将世界表示为可执行代码还有实用价值:可以直接干预底层机制(如改变质量、初速度或相机视角)来观察后果,这比像素级的重绘更能反映因果关系。通过对大量观测生成并验证这样可执行的世界假设,能够为视觉-语言模型提供可规模化的物理监督,推动模型学会基于机制而非仅凭表象的推理。

总之,把世界写成代码,不是要否定像素或三维重建的价值,而是提供一种可以被运行和证伪的表征,使得从描述现象走向发现支配现象的机制成为可能。 球友会

about image
全国女篮锦标赛四分之一决赛对阵出炉 天生带财的三大生肖:机智、善应变、财路广