一个新模型发布,三维圈子先坐不住了。
它用建模软件搭出一栋房子。
再直接导进游戏引擎。
变成能走进去逛的漫游场景。

社交平台上,玩法很快被玩出花。
有人只写一句话。
就让这个模型从零搭出一条医院走廊。

确实挺惊艳。
于是我们做了个小测试。
同一张参考图。
一张交给它,一张交给一家专做三维生成的公司。
结果摆在一起,差距有点扎眼。


同一个金发剑士。
那家公司生成的发丝根根分明。
五官清楚,斗篷和皮带还留住了层次。
盾牌上的叶片纹样也还原出来了。
通用模型这边,画风抽象多了。
头发是一整块头盔。
脸是圆眼卡通风。
身体像几段几何体拼起来。
站在建模软件里,它更像一个刚搭完骨架的手办。
差距确实明显。
通用模型都能建模了。
那还需要专门做三维的模型吗。
只看那些惊艳的演示,答案好像已经呼之欲出。
可一旦任务落到具体资产上。
尤其是角色和复杂道具。
要讲比例,要讲结构,要讲细节。
两条路线的差别立刻就露出来了。
更有意思的是另一件事。
通用模型一路狂飙的这两年,那家公司的生意没被挤掉。
反而涨得很凶。
按它自己披露的数字,一年能持续收到的订阅收入,从一百万美元涨到一亿美元。
用的时间不到两年。
先把这笔账说清楚。
这个口径算的是可持续、可重复的订阅和合同收入,折成一年。
一次性的收入通常不算在内。
它衡量的不是有多少人围观,而是已经攒下多大规模的持续付费。
这也是它被当成软件公司核心指标的原因。
那两年不到,一百倍,是什么速度。
放在传统软件行业,再好的公司,这段路通常也要走五年以上。
一家百年风投机构在年度报告里,把高速增长的团队分过两档。
前一种平均约四年做到一亿美元收入,毛利还能守住六成左右。
后一种更少见,平均只要一年半。
按这个尺度看,不到两年做完百倍扩张,已经贴近后一种的爆发力。
再找两个参照。
一家做语音生成的公司,从产品上线到一亿美元收入用了约二十个月。
一家做视频生成的公司,从一百万美元到一亿美元用了二十九个月。
那家做三维的公司,用时比后者还短。
难就难在,三维是这些模态里最不好做生意的。
声音和视频生成出来基本就能用。
三维不行。
三维资产还得过拓扑这一关。
贴图、尺寸也得对。
才能进游戏引擎,才能上打印机。
这就不容易。
视频和语音的创作者遍布全球,数以几十亿计。
三维创作者还远没到这个量级。
起点差这么远,跑出相近的速度,并不容易。
门槛在降,三维也在从少数人的工具,走向普通人。
模型越能干,专门的模型越值钱
这个新模型能在三维圈刷屏,拆开看并不神秘。
它能操作电脑,所以点得动建模软件。
它有 AI编程能力,能把一句需求变成脚本。
它懂空间,所以能判断物体的结构和位置。
对普通人来说,它更像一个越用越强的 AI工具。
所以它最擅长的,是能拆成几何关系的活。
比如结构建模,再比如参数化生成。
墙体、楼梯和门窗,都能靠一行行代码搭出来。
可开头那位金发剑士,恰好踩在这套方法最不舒服的地方。
发丝的走向。
斗篷的褶皱。
盾牌上的纹样。
这些很难写成几条几何规则。
它们是概念图里的设计本身。
要靠模型见过大量真实资产,才知道形状和细节该长什么样。
这正是专门做三维的公司要解决的问题。
输入一段文字,或者一张图,直接生成带形状带纹理的三维资产。
北京大学有个团队做过一套开源框架。
它让写代码的智能体自己拆解游戏需求。
再逐项判断,每件资产该现场生成,还是靠程序搭建,还是去开源素材库里找。
其中角色和关键道具,交给了那家公司。
资产生成完还有后手。
网格要清理,尺寸要校验。
角色还要绑骨骼、做动作。
才能真正进游戏。
项目负责人把最大的困难概括成一句话。
看起来正确,和真正可用之间,还隔着一道沟。
不少毛病,只有把资产放进能玩的场景里才会暴露。
两家协作搭废墟场景的演示,也是同样的分工。
通用模型拆场景,备参考图,再通过接口调用那家公司,逐件生成资产。

这些资产随后被导进建模软件。
摆放、调尺寸,再打灯。
规划和调度可以交给通用模型。
但真正决定画面质感的那几件资产,出自那家公司。
我们的判断是,智能体降低的是三维创作的门槛。
可它也让资产质量成了更关键的门槛。
能发起项目的人越多,角色和道具的需求就越大。
接下来要解决的,是怎么稳定拿到符合设计、又进得了生产流程的资产。
智能体越会干活,资产越成为瓶颈。
能把看起来对变成真正能用的专门模型,正是这条线上最难被替代的一环。
三道门槛,卡的是能不能用
那家公司在这套协作里的价值,最后还是要落到资产质量上。
形状准不准。
细节够不够。
颜色和图案对不对。
第一道门槛是形状。
比如这只机械猫头鹰。
参考图里的多层甲片、胸腔齿轮和雕花底座,生成结果里都保留了独立结构。
没有糊成一整块鸟形轮廓。
对美术师来说,这意味着拿到手的模型更接近原设计。
后面的修改,可以从一个有结构的资产开始。

在它自建的三维几何对齐基准里,新一代在单图输入下,造型比例、空间分布和表面细节三项都领先。
表面细节这一项拿到五十九点八。
其他受测模型大约在四十九到五十五之间。
上一代的小模型是五十二点七。
第二道门槛是细节。
7.1 版生成的兽人角色,护臂绳结有清晰起伏。
裙摆边缘还能看见编织和磨损痕迹。
这些细节长在几何结构里。
无纹理渲染下,直接就能看到。

它把几何生成分辨率从两千零四十八的三次方,提到四千零九十六的三次方。
在一个专门看细节丰富度的基准里,四 K 渲染条件下拿到二十三点一。
高于其他受测模型。

分辨率高了,模型能表达更细的凹槽、褶皱和表面纹理。
可这也让训练、推理和网格提取都更吃资源。
代价不低。
第三道门槛是颜色和图案。
这台老式收音机,难处理的并不是方形外壳。
而是铭牌上的英文,旋钮旁的数字刻度。
还有面板上不同材质的变化。
转成三维模型后,两处铭牌文字还能辨认。
刻度也留住了分段和数字。

在它发布的端到端纹理对齐测试里,新一代综合得分六十六点二。
高于其他受测方案。
这些提升背后,是围绕三维资产做的持续优化。
新一代改了图像编码器和训练数据,让输入图和目标几何对得更准。
7.1 版则扩大了生成规模,改了网格提取,让更细的结构能落到可交付的网格上。
团队还在试直接生成网格。
走流匹配路线的那个版本,能生成顶点和连接关系。
还能按预算控制网格复杂度,兼顾速度和结构。

不过技术指标再高,最后还是要回答一个问题。
谁会为它掏钱。
这是个老问题。
专业用户要的从来不是偶尔惊艳一次。
他们要的是连着生成十次、一百次,结果都八九不离十。
与其赌一次惊艳,不如看它能不能连着出十次一样的结果。
还原得越准,返工越少。
三维生成才有机会从尝鲜的工具,变成每天都要用的生产环节。
谁在真金白银地买单
眼下至少有两个付费场景很清楚。
第一个是游戏。
三维资产本来就是游戏开发里的一笔大开销。
按一家游戏美术外包公司公布的价格,一件风格化道具大约三百到两千多美元。
一个高品质角色可能超过五千美元。
钱之外,更直接的压力是工期。
角色和道具一多,三维美术很快成为项目进度的瓶颈。
三七互娱已经把这家公司的能力接进自己的流程。
碰到复杂的角色和怪物。
团队先用它生成头部和肢体这些部件。
再导进三维软件组装、精修。
这样能在人工雕刻开始前,先拿到完成度超过六成的高模底子。
在复杂的项目里,基础阶段的雕刻工作量能少三到四成。
简单道具和角色可以直接生成完整模型。
清理后继续加工。
在部分休闲和移动游戏项目里,一件资产的建模时间从五天缩到约两天半。

对动辄几十上百件资产的项目,效率会被一路放大。
美术师也能腾出时间,去处理风格和最终精修。
第二个是三维打印。
想自己动手打印的人正在迅速变多。
一家打印厂商披露,到 2025 年底,它的全球站和中国站合计注册用户约五千万。
月活到了千万量级。
可平台活跃创作者只有约三十万。
优质模型接近两百万个。
差得还挺远。
也就是说,来看、来下载和来打印的人,远远多于能自己建模的人。
打印机卖得越多,这道内容缺口就越明显。
大多数人买得起一台好用的打印机。
可依然不会建模。
缺口就卡在这。
想打一个真正属于自己的手办,往往只能等别人先做好。
那家公司瞄的正是这一环。
让不会建模的人,也能把想法变成能打印的三维模型。

随着它把多色打印能力做进产品,几家打印品牌也陆续进了它的客户名单。
把这些案例放在一起,增长的来路就清楚了。
第一层是个人订阅。
独立开发者、老师和打印爱好者,不用先学会专业建模软件。
一个 AI工具,就能把文字和图片变成模型。
第二层是企业接口。
几家游戏公司把生成能力接进原有管线后,需求就不再止于偶尔生成一个模型。
一个项目要几十甚至上百件资产。
项目越多,接口调用量越大。
放眼全球市值和估值排前十的企业,其中一半已经把它放进了生产链条的关键位置。
第三层是硬件生态。
它进到打印品牌的用户链路后,模型生成的需求,又会跟着打印机销量和活跃用户一起涨。
在我们看来,企业接口和硬件生态,才是收入能持续放大的关键。
这些最后都写进了收入曲线,也解释了那家公司为什么能在不到两年里,把收入从一百万美元推到一亿美元。
快的关键,是它跨过了生成出来和投入使用之间的距离。
模型质量越高,返工越少,进的生产流程就越多。
进的生产流程越多,用户的生成需求就越容易从一次尝试,变成高频调用。
所以一亿美元证明的不只是有人愿意为三维生成买单。
它意味着这套商业循环已经初步跑起来了。
模型能力推动实际使用,实际使用带来收入,收入再支持模型和工程。
专门模型的门槛,也就不只存在于参数和排行榜里。
还在于它已经进了多少真实的生产流程。
下一批用户,是想玩的人
不到两年做到一亿美元,证明三维生成已经是一门成立的生意。
但今天的收入,主要还是来自帮人完成三维工作。
游戏美术、建模师和设计师,愿意为效率掏钱。
可这终究是一个有限的人群。
如果还想继续涨,下一个问题就是。
除了帮专业人士生产资产,它能不能让更多普通人直接创造和消费三维内容。
这正是它从工作走向乐趣的原因。
它新推出的一套实时互动架构,就是这条路上的一次尝试。
在里头,你可以走进一个房间。
和场景互动,找出解开空间谜题的路径。

也可以走进拳击场。
把老板的照片放到拳击台上,然后重拳出击。

这些互动能实时发生,靠的是一套分层架构。
写代码的智能体负责搭结构、写运行逻辑。
那家公司生成空间和三维资产,同时向实时视频模型输出控制信号。
视频模型再根据信号,实时生成画面和声音。
其中三维是撑起整个世界的骨架。
它定住位置。
这两年,世界模型成了圈子里的热方向。
谷歌的 DeepMind 发布过一个模型,能按文字实时生成可探索的场景。
可纯靠视频生成的世界,空间一致性始终是道难题。
玩家走远再回来,桌上的东西可能已经换了位置,甚至直接消失。
新架构的思路是用三维先把空间钉住。
再让实时视频模型负责画面表现。
房间在哪,门通向哪,物体摆在什么位置,都由三维结构定。
玩家推开的每一扇门,放上拳击台的每一张照片,都对应空间里真实存在、能持续交互的对象。
到这里,三维已经从生产流程里的一项资产,变成了可玩世界的地基。
这条路线真正打开的,是三维生成的用户边界。
过去一个点子要变成能玩的游戏。
中间隔着建模、编程和美术,还要过游戏引擎这一关。
每一道门槛都要专业人员和大量时间。
新架构把这些活分给了不同模型。
普通人不用掌握完整的游戏开发流程。
也有机会把一句话、一个念头,变成能走进去的世界。
这才是乐趣真正抬高天花板的地方。
与其纠结哪个模型更会做单张图,不如看谁能把一整个流程接住。
三维生成的市场规模,不再只取决于世界上有多少三维美术。
还取决于有多少人想玩,多少人想创造自己的世界。
它还有个关键设计。
写代码的智能体越强,它能设计的玩法越复杂。
那家公司的三维生成能力,负责把这些玩法变成稳定、可进入的场景。
至此,开头那个问题也有了答案。
通用模型都能建模了,市场还需要专门的模型吗。
在生产端,通用模型越能干活,能发起的项目越多。
高质量三维资产的需求,也跟着涨。
到了互动内容这端,写代码的智能体越强,能设计的玩法越复杂。
对稳定三维空间的需求,同样更大。
前者负责理解意图、组织任务。
后者负责生成真正可用、可控和可交互的三维世界。
通用模型越强,专门模型能接的需求反而越多。
这也解释了那家公司为什么还要往实时互动内容走。
从一件能用的资产,到一个能玩的世界。
它想覆盖的,已经不只是三维生产工具的市场。
