论文精读|Neural Computers:把计算、内存与 I/O 压进一个学出来的 runtime
原论文:Neural Computers
作者:Mingchen Zhuge, Changsheng Zhao, Haozhe Liu, Zijian Zhou, Shuming Liu, Wenyi Wang, Ernie Chang, Gael Le Lan, Junjie Fei, Wenxuan Zhang, Yasheng Sun, Zhipeng Cai, Zechun Liu, Yunyang Xiong, Yining Yang, Yuandong Tian, Yangyang Shi, Vikas Chandra, Jürgen Schmidhuber(共 19 位,MetaAuto-ai / Meta·FAIR / KAUST 等)
arXiv: 2604.06425(v1 2026-04-07,v2 2026-04-16)|项目仓库|官方博客
这篇论文想回答一个相当有野心的收敛问题:当 agent 真的开始干活、世界模型真的开始仿真环境、传统计算机的软硬栈也在为 AI 重塑自己的基底——那有没有可能存在一种新的 runtime,把”执行、rollout、能力沉淀”统一进同一台学出来的机器里? 作者把这台机器命名为 Neural Computer(NC),把它的成熟形态称作 Completely Neural Computer(CNC),并把它定位为”超越今天 agent 与传统计算机的一种新计算范式”。
有意思的是,论文并没有一上来就讨论怎么造 CNC,而是反过来问一个最小的问题:能不能只从采集到的 I/O 轨迹里,不碰任何被仪表化的程序状态,就学到一些 NC 的基本原语? 它把 NC 具体化成一个视频模型——给定指令、当前像素与用户动作,rollout 出后续的屏幕帧——在 CLI 和 GUI 两类环境里做实验。结论也诚实:NC 能学会”接口基本原语,尤其是 I/O 对齐与短程控制”,但”routine 复用、受控更新、符号稳定性”还很难。下面拆开看。
论文信息
- 标题:Neural Computers
- 核心主张:把传统计算机里分离的”计算 / 内存 / I/O”统一进一个学出来的 runtime state;长期目标是 CNC——一个具备稳定执行、显式可重编程、能力可持久复用的通用形态
- 关键一步:只从 I/O 轨迹(无程序状态仪表化)学基本 NC 原语;用视频模型作为”最方便的统一容器”做原型
- 作者立场:这只是一个”过渡原型”,而不是 NC 的最终形态
一、为什么是现在:三条汇聚的线索
论文的动机来自三个同时发生、且彼此呼应的位移:
Agent 从原型变成基础设施。 2023 年的 MetaGPT 还只能产出几百行代码,到 2025 年 Cursor、Codex、Claude Code 已是程序员的标配,OpenClaw 把这套能力推到非程序员。Agent 面对的瓶颈很集中:长程任务的稳定性、能力的留存与复用、工作流的可复用。主流解法是往 scaffold/harness 上加结构(更强的记忆、更长的工作流、更紧的动作回路),更激进的路是递归自改进——“模型训练下一代模型,agent 持续重写自己”。
世界模型真的进了系统。 从 Schmidhuber 1990 年的 Making the World Differentiable、到 2018 年的 World Models、再到 Waymo 的量产落地,世界模型已经不再只是”表示状态”,而是”维护一个关于接下来会发生什么的内部结构”。代表方向:自动驾驶仿真(Waymo World Model、NVIDIA Cosmos)、空间智能(World Labs 的 Marble 做 3D 世界)、实时交互环境(GameNGen 的 neural DOOM、Google DeepMind 的 Genie 2/3)。它们都在回答同一件事:“如何学到环境在时间、动作、约束下演化的规则。”
传统计算机露出结构性摩擦。 开放、长程、持续交互的任务,暴露了传统软栈的边界。芯片、编译器、内存系统、软件栈都在变得更”model-friendly”,但都还在旧范式内打转;连 Taalas 这种”把特定模型变成部署单元”的做法,也只是部署层的变化,不是新的机器形态。
收敛问题:既然 agent 在做实际工作、世界模型在仿真环境、传统计算机在为 AI 重塑基底——“那能不能有一个新的 runtime,把执行、rollout、能力沉淀放进同一台学出来的机器?” 人机关系因此会从 Human→Computer,经过 Human→Agent→Computer,变成人直接面对一台 Neural Computer。
二、Neural Computer 到底是什么
作者很刻意地做了一组排除法,避免 NC 被理解成某件它不是的东西:
- NC 不是更强的 agent;
- NC 不是专门为计算机环境做的世界模型;
- NC 不是架在传统计算机之上的智能层。
它的真正命题是:那些现在由程序栈、工具链、控制层承担的责任,能不能逐步迁进模型真正依赖的那个 runtime 里。 也就是说,问题不在”模型能不能完成某项任务”,而在”模型能不能接管一部分至今仍属于机器本身的运行时职责”。
| 维度 | 传统计算机 | Agent | 世界模型 | Neural Computer |
|---|---|---|---|---|
| 围绕什么组织 | 显式程序 | 任务 | 环境 | runtime |
| 真相来源 | 显式程序与状态 | 外部环境/工具链/工作流 | 状态演化模型 | runtime 内的能力与状态 |
| 主要角色 | 执行显式程序 | 在既有环境里完成任务 | 预测/仿真环境变化 | 让机器持续运行、沉淀能力、治理更新 |
runtime 在这里的含义不是某个具体的软件组件,而是”让一台系统在时间上保持是同一台机器的那一层”:什么可以留下、什么把状态往前推、哪类输入真正改变机器。落地的问题就是——能力和状态能不能真的进同一个学出来的 runtime。
论文对成熟 NC 的机器特性也给了相当具体的猜想,这是我觉得这篇 position paper 最值钱的部分之一:
- 基底形态:不是 1B–10T 的稠密/MoE 模型,而是”一台 10T–1000T、更稀疏、更可寻址、更像电路的机器”,像一个”可组合、可路由、局部可检视的基底”,借鉴”NAND 式机器的逻辑:离散、稀疏、局部可验证”。OpenAI 的 weight-sparse transformer 被当作早期信号。
- 升级机制:不是靠重训一个更大的模型来全局改参数,而是通过持续交互长出”新的内部结构”;用户输入会变成”安装、调用、组合、保留可复用 neural routine 的方式”——“更接近内存,而不是处理器”。旧的 Neural Programmer-Interpreters(把程序分解成可调用子程序)和 HyperNetworks(生成下游神经模块)被点名是前身。
- rollout 集成:世界模型式的 rollout 会变成”机器正常操作过程的一部分”;用户可以给输入输出对、给评估准则、或什么都不给,runtime 自己靠”内部自演、自测、候选筛选、压缩”继续往前。
三、完全体 CNC:四条硬条件
CNC 是”NC 的完成形态”——一个 NC 实例只有同时满足下面四条,才算得上 CNC。这四条也恰好是论文用来给当前原型自评的尺子:
- 图灵完备(Turing Complete):不能只扛固定任务类型,“原则上应能表达通用计算”。真正的考验是”随着有效内存与上下文增长,同一台 NC 能不能稳定承载更长、更复杂的算法过程。”
- 可通用编程(Universally Programmable):输入不应只触发一次性行为,而要”作为 routine 或内部执行器被安装、之后可再调用”;能力必须”可安装、可调用、可组合、可保留”,并且”跨任务可复用”。
- 行为一致(Behavior-Consistent):“普通使用不应悄悄改动机器。行为变化只能来自显式更新。”同版本内行为可复现;执行与更新轨迹可追踪;失败要能 replay 与回滚;“长期漂移应可测量、可治理。”
- 机器原生语义(Machine-Native Semantics):不是”用神经网络去模仿旧计算机”,而是长出”自己的机器语义和被编程的方式”。神经基底要靠”组合、路由、连续状态、内部执行结构”获得能力——这些恰好是传统软栈不擅长的;同时”指令、示范、轨迹、约束本身也开始和手写代码一起充当编程输入。”
原型的自我打分很诚实:图灵完备”只在边缘碰到过一点”,可通用编程”几乎还没出现”,行为一致”只在受控环境里局部成立”,机器原生语义”作为一个方向比作为一个结果更清楚”。作者估计”一台真正的 Neural Computer 大概还差三年。”
四、怎么造:先把 NC 装进视频模型
论文选视频生成/世界模型架构作为 NC 的”最方便统一容器”——它能”把像素、动作、时间 rollout 放进同一个端到端原型”。但作者反复强调这些只是过渡原型,不是 NC 的最终结构。
4.1 CLIGen(general):先学会「runtime 的样子」
目标:视频模型能不能把终端行为渲染得像——颜色、光标、滚动、TUI 布局、节奏。训练数据约 1,100 小时风格多变的通用终端视频,基座是 Wan2.1(“起初几乎不懂计算机界面,连稍小一点的文本都搞不定”)。
学到的是终端的”外层”:颜色切换、光标闪烁、窗口比例稳定、日志滚动、TUI 布局、进度条与状态栏。作者的原话很到位——“这里先学到的,还是 runtime 的样子(appearance of runtime)。”模型对常见命令、echo、日志格式有”非平凡的浅层对齐”。对视频生成来说,终端场景是”最难的一类场景:文本密集、变化快、光标闪烁、几乎没有自然运动。”
4.2 CLIGen(clean):REPL 里验证 I/O 对齐
目标:终端能不能被当成”一台被动作稳定驱动的小型本地机器”——buffer 前进、enter 后 echo、编辑后状态是否连贯延续。数据换成了用脚本和 Docker 生成的、可复现的干净轨迹,给出稳定的终端环境。
论文给出了结构化的动作序列作为输入规格,比如:
Sleep 200ms → Type "env | head -n 5" → Enter → Sleep 600ms → HideSleep 200ms → Type "date" → Enter → Sleep 300ms → Type "whoami" → Enter → Sleep 300msSleep 200ms → Type "whomai" → Enter → Sleep 300ms → Type "whomai" → Enter(出错/重试)Sleep 200ms → Type "top" → Enter → Sleep 2s → Down 3 → Sleep 600ms → Up 2Sleep 400ms → Type "python - <<'PY'" → Enter → ...(多行 Python 执行)Sleep 200ms → Type "python" → Enter → Sleep 1s → Type "10+15" → Enter
结果:对简单命令(pwd、date、whoami、echo $HOME、env | head -n 5),“键入、回车、echo、最终显示已经相当接近真实”,命令能产出”与对应终端场景匹配的输出形状”。模型学到了”计算机终端最基本的若干运行规律”——命令驱动”字符更新、echo
生成、本地状态变化”。
但算术是软肋:简单算术场景里”学到一点东西”,可”哪怕是两位数加法,当前模型也还算不稳定”。作者给两个假设:(1) 硬训练数据不够;(2) 更深层的可能——“让当前 DiT-based 视频模型承载稳定推理,本身可能就是个错赌。”结论一句话:“终端执行开始立住了,符号推理还没立住。”
4.3 GUIWorld:动作能不能真的驱动界面
目标:动作是否真的驱动界面状态——点击、悬停、输入、窗口反馈形成闭环。环境用 Ubuntu 22.04 + XFCE4,1024×768,15 FPS 采集(搭自 NeuralOS 的设置)。数据管线做完整的桌面执行/录制/动作重放,保证”每一次点击、悬停、输入、界面变化都能稳定记录”。
数据组成:
| 部分 | 时长 | 用途 |
|---|---|---|
| Random Slow | ~1,000 h | 探开放世界噪声:鼠标加速、停顿、悬停、窗口切换 |
| Random Fast | ~400 h | 额外噪声探测 |
| Goal-directed(Claude CUA) | ~110 h | 干净的动作-响应对:动作后界面有没有走对下一步 |
论文试了四种动作注入架构(对应原文 Figure 7):
| 模型 | 名称 | 注入方式 | 相关工作 |
|---|---|---|---|
| Model 1 | External | 输入侧 latent 调制 | 浅层动作条件基线 |
| Model 2 | Contextual | 动作 token 并入主序列 | WHAM |
| Model 3 | Residual | 经旁路残差分支注入 | ControlNet |
| Model 4 | Internal | 每个 block 内部动作交叉注意力 | Matrix-Game 2.0 |
最优是 Model 4(Internal):“在细粒度计时与局部交互的 GUI 环境里,把动作直接注入 block 内部,是教骨干理解动作后界面应如何延续的最有效方式。”
两条数据侧的发现很有指导性:110 小时有监督数据胜过约 1,400 小时随机数据;“对光标做显式视觉监督,远好过纯坐标监督。”实操结论:GUI 的进展依赖更强的动作语义、更清晰的状态转移,以及”把光标当作一个视觉对象来监督”。
I/O
对齐方面,论文给了真值传统计算机行为与神经计算机生成的一一配对,动作规格是
thinking + action 对(如 left_click +
坐标、type "512" 后 left_click 点
OK、double_click 开 Firefox
等)。生成结果能匹配真值动作,说明模型已学到”界面渲染、页面跳转、短期状态延续、局部交互、执行
echo,甚至一些非常早期的工作记忆迹象。”
五、三块绕不开的硬骨头
5.1 routine 复用与能力安装
当前能力并没有真正以”可持久、可调用”的方式进入 runtime。“可通用编程”要求能力”可安装、可调用、可组合、可保留”且”跨任务可复用”,原型基本没做到。愿景是用户输入变成”安装、调用、组合、保留可复用 neural routine 的方式,甚至是之后可再调用的内部执行器”。这需要类似软件安装、但在神经基底上运作的机制——新的子网络要被生成并”以即插即用的方式内部挂接”。
5.2 受控更新与治理
“行为一致”要求”普通使用不应悄悄改动机器”,原型”只在受控环境里局部成立”。完整 CNC 需要:同版本内行为可复现、执行与更新轨迹可追踪、失败可 replay 与回滚、“长期漂移可测量、可治理”。而且 rollout 集成里 runtime 自己做的”内部自演、自测、候选筛选、压缩”也必须全程可治理——“整条更新路径都得保持可治理。”
5.3 符号稳定性与推理
符号推理是最弱的一点,连两位数加法都不稳。作者两个假设都摆出来了:数据不够,或者结构上”让 DiT-based 视频模型承载稳定推理本身就是个错赌”。“图灵完备”要求系统能表达通用计算、且”随有效内存与上下文增长能稳定承载更长更复杂的算法过程”——这显然还远。
5.4 机器原生语义
“机器原生语义”这一条”还是方向比结果更清楚”。神经基底要靠”组合、路由、连续状态、内部执行结构”长出自己的机器语义;编程输入也要从代码扩展到”指令、示范、轨迹、约束本身”。
六、路线图:离 CNC 还有多远
作者估计”一台真正的 Neural Computer 大概还差三年”,当前原型相对于愿景”仍只是早期一步”。基底要从稠密/MoE 基座走向”10T–1000T、更稀疏、更可寻址、更像电路”,这要靠根本性的架构创新,weight-sparse transformer、NPI、HyperNetworks 是被点名的先驱。
| 维度 | 传统计算机 | 个性化超级 Agent | Completely Neural Computer |
|---|---|---|---|
| 你得到什么 | 精确执行程序的机器 | 有强记忆/工具使用的持久 agent | 由经验塑形、能力在系统内的机器 |
| 经验沉淀 | 手动翻译成代码/配置/规则 | 写进记忆、向量库、工作流、MCP、prompt,再检索注入 | “直接进 runtime,参与后续执行” |
| 安装的是什么 | 软件、库、脚本、服务 | 工具、工作流、记忆条目、skill 描述 | “能力本身,以及可安装、可调用、可组合的子神经网络” |
| 基底 | N/A | 稠密/MoE,1B–10T | 更稀疏,10T–1000T,更可寻址,更像电路 |
| 栈位置 | 芯片/基础设施 | 模型与应用层 | “改写模型与应用的边界,可能推动基础设施围绕 runtime 重组” |
| 成熟度 | 完全成熟(70+ 年) | 已可用、改进快 | “方向合理、形式原型已现,但远没有可用原型” |
如果 CNC 真的到来,“被安装的会更像能力本身”。代码仍重要但”不再是唯一的入口”。“程序”一词会变成”一个可安装、可组合、可版本化、可随时间更新的能力对象”。软件布局、硬件接口、更新治理、调试都会”围绕同一台持续运行的机器重组”。手机、浏览器、IDE、终端都会变成”那同一台机器的不同窗口”,最终改变”我们所说的计算机到底意味着什么”。
七、为什么把它放进「世界模型」这个分类
这篇看起来是”计算范式/系统”口味的论文,但把它放进世界模型分类是贴的,理由有三:
- 它的原型就是世界模型。 NC 用视频/世界模型架构做过渡原型——给定像素、动作、指令,rollout 出后续屏幕帧。这正是世界模型在做的事:学到环境在动作与约束下如何演化,并预测下一状态。CLIGen 学”命令→echo→状态变化”、GUIWorld 学”动作→界面反馈”,本质都是在学计算机这个环境的动力学。
- 它的思想脉络就在世界模型谱系里。 论文把 Schmidhuber 1990 的 Making the World Differentiable、2018 的 World Models、GameNGen、Genie 都列进了动机。NC 的”rollout 集成进 runtime”主张,正是把世界模型从”仿真器”升格成”机器正常操作的一部分”。
- 它指向了世界模型的下一站。 主流世界模型学的是物理/游戏/驾驶环境;NC 把同一套思路对准”计算机这个环境本身”,并要求 rollout 与能力沉淀、更新治理绑定。对做世界模型的人来说,这是一条清晰的延展轴:从”预测环境”到”让预测本身成为可累积、可治理的运行时”。
一句话总结
Neural Computers 提出把计算/内存/I/O 统一进一个学出来的 runtime(成熟形态 CNC 有图灵完备、可通用编程、行为一致、机器原生语义四条硬条件),用视频世界模型作过渡原型验证了”只从 I/O 轨迹学到接口原语”是可行的——I/O 对齐与短程控制立住了,但 routine 复用、受控更新、符号稳定仍是硬骨头,作者自评离真正的 NC 大概还差三年。对世界模型方向,它是一条值得盯住的延展轴。
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。