神经渲染成为玩家视觉体验的末端 所以有人将它跑在了第二张显卡上
- +1 你赞过了
【天极网DIY硬件频道】过去几年,DLSS 技术在玩家群体中的印象相当固定:从最早的超分到后来的帧生成,它一直在做减法,把渲染分辨率压下去,再通过Tensor核心与AI算法把画面“脑补”回来,在尽量减少画质损失的同时让帧率更加好看,但DLSS 5改变了这种印象。它引入3D引导神经网络渲染,不再放大像素,而是由生成式模型在整张画面上重绘光影与材质。NVIDIA也明确表示,这项技术平均产生多达50%-60%的性能损失,旗舰卡也不例外。
麻烦还不止于此。传统超分按渲染分辨率计算负载,原生画面越小越轻松;神经渲染负载却与最终输出的完整像素总量强相关。哪怕内部渲染压到720p,只要输出是4K,模型照样要在830万个像素上跑完运算。对玩家而言,熟悉的DLSS性能档位减负效果,在面对新一代DLSS 5神经渲染时更加捉襟见肘,超分能换回的收益只剩三分之一左右。
我们很容易想到,既然一张显卡既运算游戏、又跑神经渲染模型会忙不过来,那何不将相对独立的负载拆成两部分。9月7日,开发者maohgad-web在GitHub开源了项目Neural Coprocessor,核心是一个叫MGPU Bridge的ReShade插件。思路很直接:一张显卡运行游戏本身的计算与光栅渲染,另一张全权负责神经渲染,以分工方式把负载解耦。
这条路走得通,是因为神经渲染恰好是渲染管线的最后一个环节。它接收一张画完的帧、返回一张完工的帧,中间不参与几何与光栅;NVIDIA也确认它跑在Blackwell第五代Tensor Core上,与帧生成不同,不需要等待下一帧。既然它不挑设备,又没有上下文依赖,就机会被拿到另一套硬件上执行。
具体做法分五步:先从交换链识别游戏在哪块适配器上渲染,再在另一块适配器上建立自己的D3D12设备,然后把每张完成的帧通过跨适配器共享堆复制,由副卡执行神经渲染,最后在副卡自己的窗口里输出。最后一步同样关键:结果不回传主卡,这是因为画面的数据量来回传输只会挤占PCIe带宽,并进一步提升延迟。
不过这套流程也有它的问题:神经渲染依赖游戏引擎给出的运动矢量与深度,而游戏不一定在任何场景下都支持这一点。项目作者在文档里描述称,引擎级运动矢量只在游戏本身启用DLSS或DLAA时才可用;如果游戏用的是TAA等传统抗锯齿,模型就只能退回到从画面颜色反推运动,也就是早期版本的做法。作者在《战地 6》上实测,开启DLSS或DLAA时96%到98%的帧能拿到可用运动矢量,切到TAA则一帧都拿不到。也就是说,这套方案的适配性更多取决于游戏对相关技术的支持。
作者用两张RTX 5060 Ti 16GB做了实测演示,游戏是以1080p运行的《黎明行者之血》。DLAA档运行时的67至70帧,开启神经渲染后掉到44帧,将负载挪到副卡后可重回约70帧;DLSS性能档127至131帧开启神经渲染后掉到59帧,借助副卡可跑到106至107帧,同时主卡核心温度可下降约21摄氏度。
项目作者认为:比起帧率,不同档位下DLSS 5超分性能与神经渲染之间此消彼长的关系更值得观察。由于神经渲染会把运行它的设备吃满,永远按输出分辨率运行,开销几乎不随档位下降,而渲染负载却不断被挤占,于是性能档超分相比原生(DLAA)不再能带来理想的性能提升结果,单卡只能带来39%的增益,而将神经渲染负载搬到副卡则能保住86%。
测试结果显示,对比单卡跑神经渲染状态,游戏的整体性能提升可达127%,但如果对比关掉神经渲染的原生性能,副卡方案仍然损失8%到17%,证明了这套方案本身的额外损耗。另外,这个项目已经迭代到 0.2.3,修复搭载 NVIDIA Streamline 的游戏里启动崩溃的问题,以及《赛博朋克 2077》开启光线重建时的深度绑定失败,还改进了核显检测功能。据称RTX 40系显卡配合改版模型文件,作者也确认已经可用。
双卡方案虽然从性能角度让DLSS 5神经渲染变得更加可用,但也存在不少实际限制。它只支持DirectX 12,需要两张较高规格的新一代RTX显卡和两台显示器,需要特定版本的ReShade构建且不能再装其他插件,模型文件还要自备。帧生成作者未测试也不推荐,多数游戏中UI的运动矢量仍然缺失,色彩处理没有完全实现,画面可能发灰,需要手动调节。作者本人在演示中明确标注:端到端延迟未测量,画质也未做过评估,0.1.0版本的项目测试只覆盖两台机器和有限几款游戏。
小结
官方在GTC上第一次演示DLSS 5时,用的就是两张RTX 5090,社区做的事,是把接近官方演示使用的架构复现并开源。但这一社区项目目前不受官方支持,也不会有相关技术适配。同时因为它靠ReShade注入工作,在带反作弊的在线游戏里运行无疑产生封号风险。此外物理分工也带来不可避免的代价,帧要跨卡传递,图形管线被整体拉长,延迟的提升不会因为帧率好看就消失。
这不像是很多人想的SLI复活:主卡独立计算和渲染游戏帧,副卡只是以神经渲染处理图像收尾,不会带来性能叠加或者说帧率翻倍。比起SLI它更像是十几年前那张专门跑PhysX物理计算的加速卡。这也不意味着以后人人都得插两张显卡,而是指向了一个点:当重度负载的AI应用进入日常的生活、工作与娱乐,我们可能比以往任何时候都更需要一种独立的加速硬件。
社区甚至在探索一种有趣的可能:先使用A卡计算渲染游戏帧,再使用N卡进行神经渲染处理。这种跨生态的混合架构能否真正成为现实,我们也将继续关注。
最新资讯
热门视频
新品评测
X
微博认证登录
QQ账号登录
微信账号登录