开云·Kaiyun(中国)官方网站-科技股份有限公司-kaiyun平台登录入口它径直将视觉和语言映射为当作-开云·Kaiyun(中国)官方网站-科技股份有限公司

kaiyun平台登录入口它径直将视觉和语言映射为当作-开云·Kaiyun(中国)官方网站-科技股份有限公司

发布日期:2026-07-27 11:06  点击次数:127

kaiyun平台登录入口它径直将视觉和语言映射为当作-开云·Kaiyun(中国)官方网站-科技股份有限公司

逛过WAIC具身智能展区的东谈主,多半有吞并个疑问:

都2026年了,机器东谈骨干活,怎么照旧慢吞吞的?

转头一揣度,公共默许的谜底是:本事不行,快不了。

但一位刚缔造机器东谈主公司的负责东谈主,给出了一个扎心得多的解释:

不是不成快,是怕出错。速率是不错调快的,调快以后出错概率就会加多,给别东谈主演示的时候就会掉链子。

原本,展台上的慢,是主动调低的安全档。

而不敢调快的根源,正是行业如今热议的「大脑」:机器东谈主的大脑,还没跨过实用门槛。

换个环境、换个物体,当作就运行变形,是以许多展示只可停留在Demo层面,在全心布置的场景里防卫完成。

说这话的东谈主叫潘嘉,国度科技高出一等奖主要完成东谈主、科大讯飞隆起科学家、具身智能前沿科学带头东谈主。

就在WAIC 2026开幕前,科大讯飞暗暗注册了一家新公司:安徽爻方智能科技有限公司,注册成本3亿元,由潘嘉带队,专攻的正是机器东谈主大脑。

同期,团队结伙中国科学本事大学、聆动通用机器东谈主交出了一篇本事论述:iFLYTEK-Embodied-Omni。

论述很厚,判断却很短:

面前主流的机器东谈主大脑,造法就不合。

VLA不是末端,寰球模子还需补上「实践明白」这一环

总结下来,爻方的念念路不错概述成这么两点:

第一,VLA不是末端。这个当下最热的门道,天花板在哪还没东谈主考据过,但表面上的短板,仍是摆在了明面上。

第二,接棒VLA的寰球模子,也有不错完善的空间,比如「实践明白」这味枢纽药前言。

要融合这两点,不妨来齐全看一下悉数这个词行业围绕「大脑」的这场强烈争夺。

为什么公共都在争「大脑」?这背后其实是一个渐渐成型的共鸣:具身智能果然的瓶颈,从来不在身段,在大脑。

原因很浮浅,交互神气变了。

曩昔几十年,东谈主机交互停在离身的标记层面。你讲话它识别,你打字它打发,恒久隔着一块屏幕。

而具身交互要的是另一件事:机器东谈主得用身段走进物理寰球。

倒一杯水,它就得知谈壶有多重、水会怎么流、洒了怎么办。每一个当作背后,都是对物理端正的融合和推演。

这不是智商的线性延长,是一次底层跃迁。

而承担此次跃迁的,只然而大脑。身段的要津、电机、贤达手,供应链一年比一年正经;但让身段知谈该作念什么、会发生什么的那颗大脑,还没造好。

瓶颈在此,战场也当然在此。

至于这颗「大脑」怎么造?行业的分歧,联结在两件事上:用什么架构,和拿什么数据喂。

先说架构之争。

很长一段时辰里,VLA都是齐备主流。它径直将视觉和语言映射为当作,顺利快、门槛低,是以一时备受追捧。

但VLA的软肋也越来越清亮:

它更像一个「即时反映系统」,只管面前怎么作念,不管作念完之后寰球会造成什么样。

就好比在路上开车,看到红灯它如实知谈踩刹车,但它预判不到雨天路滑、这一脚下去车会打滑失控。

只对当下作念反映,不合后果作念推演——这便是「VLA不是末端」这一判断的压根原因。

△图片由AI生成

正是看到了这少量,寰球模子接棒火了起来。其逻辑在于:

先展望畴昔画面,再从画面推迁徙作,让机器东谈主也学会「先想后动」。

英伟达把这条路的牌号「Physical AI」喊成了年度枢纽词,各门第界模子在榜单上轮替刷榜,行业运行集体从VLA迁向WAM(World Action Model)。

看上去标的是对了,但爻方觉得:这内部还藏着两个坑。

第一个坑是谬误累积。

主流寰球模子把展望和当作拆成两步串行:先生成畴昔画面,再从画面反鼓励作。问题就出在这中间的派遣上,视觉展望一朝出错,谬误就会径直传导进当作,任务越长,滚得越大。

学界给这个坑起过名字,叫「可实行性范畴」:

画面生成得毫无舛误,物理上却压根作念不到,机械臂一实行就露馅。

第二个坑更荫藏,即枯竭实践明白。借用潘嘉提到的打羽毛球的例子:

好的露出员会预判球的落点和速率,同期他对我方身段的极限能作念到什么,也极度明晰。球在这里,我是跳曩昔扣杀,照旧够一下把它救回来。

而面前的寰球模子,未必缺了后半句。

面前的寰球模子,更多照旧在热心展望这少量。不管是寰球模子照旧之前的policy,都没办法通过任务去加多对实践的刚劲。

预判寰球,却不刚劲我方。画面算得再准,不知谈这具身段作念不作念获取,当作照样破碎。

这,便是爻方要补的那味药前言:实践明白。

△图片由AI生成

故意念念的是,英伟达其实也踩过前一个坑。

它早期的打法是圭臬两段式:Cosmos负责作念梦,生成机器东谈骨干活的视频,再从画面里反鼓励作。到了本年2月的DreamZero,也便是新一代GR00T 2的基础底细,英伟达改了主意,把展望画面和生成当作塞进了吞并个模子里结伙老到。

换句话说,爻方押的「结伙生成」这条路,头部玩家也走到了吞并个路口。

但走到路口之后,两家迈的腿不太一样了。

在英伟达的决议里,机器东谈主的实践气象仅仅喂给模子的一个输入信号;而在爻方这里,刚劲实践是沿路必答的老到任务——告诉它畴昔几帧要到的位置,让它我方算出每个要津该怎么转。

一个把身段当要求,一个把身段当考题。

这个别离有多紧要?英伟达我方的本事文档里也写得很直白:靠2D视频作念预老到,深度和空间调会通失准,展望看上去没问题,机械臂一伸手,够偏执八成没够着。

△图源英伟达官网

画面临了,当作破碎。病根,照旧不刚劲我方。潘嘉在采访里也正面聊过这层各别:

以往的模子没办法通过任务去刚劲实践,爻方干脆把逆露出学作念成了任务自己。

架构上的各别渐渐表现,那数据呢?

机器东谈主数据比语言数据少了几个量级,Scaling Law这张底牌于今没能翻开,真机泛化也就迟迟莫得公认解法。

脚下行业能用的数据泉源,无非这几种:

△图片由AI生成

面临数据这谈坎,爻方又甩出了一个让东谈主不测的说法:行业当下最主流的叙事,可能是个罗网。

面前行业最浩繁的作念法是:先量产再收罗。

先最低为止跑起来,让数据当然回流,带动飞轮转起来,模子就能越来越强。

特斯拉考据过的路,机器东谈主再走一遍。

但潘嘉对这种作念法合手保钟情见。

在他看来,服从不外关就大领域铺货,用户不会买单,数据飞轮压根转不起来。飞轮的前提是有东谈主沸腾用,而不是先把轮子造出来。

量产之前,领先要跨过实用门槛。盲目上线,临了罢休的便是品牌,第一个吃螃蟹的东谈主,就造成了先烈。

听上去很故意念念意念念,不外要贬责的问题却很现实:

不靠量产堆数据,泛化从哪来?

细挖爻方的解法

爻方的谜底,其实就写在那篇本事论述里:用更明智的架构,把有限的数据用到极致。

具体怎么落地?这内部有几个比拟枢纽的当作。

枢纽1:大脑,是双核的

传统VLA的短板前边说过了。

入木三分,iFLYTEK-Embodied-Omni在VLM除外,挑起用入VGM(视频生成模子),来负责展望畴昔的视觉气象。

说白了,机器东谈主在动手之前,先在脑子里把当作的后果预演一遍,这种「预感」在永劫序任务里尤其枢纽:

传统VLA经常只可等诞妄发生后被迫营救,而它能在行动前就主动回避风险。

不外这里有个细节很值得琢磨:为什么偏巧挑视频生成来干展望这活?

脚下行业里能展望畴昔的本事门道主要有三条,而「视频生成」在不少东谈主眼里恰正是当中「不够高档」的一条,但爻方偏巧选了它。

△图片由AI生成

关于这点,潘嘉也没藏着掖着:

面前的视频生成亦然用自回首大模子结合扩散模子作念的,跟咱们整套模子的backbone比拟契合。

因为和自家架构合得来,是以选了它。至于将来会不会换其他门道,他也没把话说死,等哪条路正经了相似能为我所用,脚下先挑最跑得通的那条。

求实,是爻方的底色。而它给模子取的名字,藏着相似的负责。

除了寰球模子,咱们还有传统的VLA、policy学习,还加多了像逆露出学这么的任务,是以我叫它Embodied-Omni(统一多模态具身基础模子),而不是径直称作WAM。

一个「Omni」,装下了融合、展望、当作三件事。

而其中的逆露出学任务,正是前边反复说的那味药前言,「实践明白」的落地神气。

需要阐明的是,「实践感知」(Proprioception)在机器东谈主学中并非新主见,传统机器东谈主很早就通过要津角度、扭矩等传感器来感知自身气象。

但感知是一趟事,明白是另一趟事。传感器能告诉模子身段面前在哪,不等于模子懂这具身段能作念到什么。此前的本事门道,岂论VLA照旧主流寰球模子,都很少把后者当成老到狡计,融进端到端的具身大模子里。

爻方的作念法是:不径直告诉模子手该怎么动,只给它看要到达的至极,逼它我方补全中间每一步,练的便是一副「身段的直观」。

展望畴昔,是学会看寰球;逆露出学,是学会看我方。

比主流的寰球模子多作念一步,这正是爻方的取胜之谈。

枢纽2:大脑和小脑,得及时协同

光有双核还不够,两个脑区怎么伙同,相似是门知识。

传统作念法是「大脑想完,再交给小脑作念」。接头和实行分红两段,信息单向传递,一棒接一棒。

听着顺,但谬误累积的坑让东谈主头疼。

iFLYTEK-Embodied-Omni把这套串行改成了「大脑-小脑」协同:

VLM(融合接头)、VGM(预判建模)、AGM(当作生成)三个模块,通过分享的多模态自介怀力机制及时交互。

其中VLM和VGM组成高层大脑,管教导融合、任务接头、程度追踪和畴昔展望;

AGM是低层小脑,把接头好的子狡计翻译成能落地的当作。

照旧拿羽毛球说事。

球飞过来,大脑先判断球速和落点、推断打算这一拍怎么接,小脑同期预判我方的身段够不够得着、该用多纵脱。

两件事不是等一个想完另一个才动,而是险些同期发生,一气呵成。

大脑和小脑及时对话,当作才气又快又稳。

枢纽3:以空间推理弥补真机数据不及

架构再巧,也得罕有据喂。

既然要让有限的数据发扬最大作用,那挑什么数据、怎么配比,就成了枢纽一步。

和大大批公司把钱砸在真机数据上不同,爻方的配方,偏巧反着来。

带当作标注的机器东谈主轨迹→26.88%;无当作的东谈主类操作视频→18.95%;通用VQA数据→5.06%;空间推理、感知与任务接头→49.11%。

最刺方针是临了一档。

快要一半的老到数据,是2D/3D轨迹、2D/3D定位、空间指向、物体指向、任务接头这类「具身大脑数据」。

它们不需要一台真机吭哧吭哧去跑,却能结构化地喂出模子的「空间感」和「接头力」。

白纸黑字,模子评测得益单便是最佳的阐明。

不外在此之前,还得浮浅说一下爻方的老到规律。

融合、展望、当作,三个模块要学的东西天渊之别,一股脑混着训,模子很容易疲于逃命。

是以爻方分了四步走:前三步让VLM、VGM、AGM各自开小灶,把专长练塌实;临了一步再结伙微调,让三者在吞并个框架里互相对皆、协同起来。

四步走完,得益相配能打:

LIBERO-Plus零样本基准(七种环境扰动下考泛化):平均得胜率89.6%,杰出其时最强的VLA和WAM规律;RoboTwin 2.0双臂协同基准:圭臬与就地环境区别拿下93.68%和93.16%,险些不受侵犯;永劫序任务(连作念七步,最考验展望智商):就地环境得益反而更高,环境越乱,双核大脑越显本领。

不外跑分归跑分,能不成落到真机上,是另沿路坎。

好在这条路,讯飞仍是用真机蹚过了。

爻方出底座;科大讯飞控股子公司安徽聆动通用负责工业具身大脑-小脑-实践全链路自主可控,同期兼具实践和硬件。

P.S. 视频顶用的照旧聆动此前自研的iFlyBot-VLM和iFlyBot-VLA模子~

但这不影响论断:真机仍是能落地干活,阐扬这条路走得通;剩下的,是把大脑换成更强的一颗。

标的仍是有了,剩下的是时辰问题。

新公司是新的,但这盘棋不是

到这里,许多看似浮浅的事情,也变得耐东谈主寻味起来。

你以为这是讯飞又缔造一家新公司的故事,但背后其实是:一家公司十几年的积贮,等来了一个时期的转向。

先说这十几年的积贮。

讯飞最硬的家底,其实就藏在著作伊始阿谁场景里,机器东谈主当作慢,是因为怕出错、跨不外实用门槛。

而「怎么把一项本事逼过实用门槛」,恰正是讯飞曩昔十几年作念得最多的一件事。

早年作念语音识别,讯飞面临的客户是汽车厂、家电大厂。这些客户不看Demo,只认真章:车载语音在方言和杂音里能不成不出错,家电听错一次教导,用户可能就再也不掀开了。

潘嘉就感叹,正是被客户一年年提着更高的要求打磨,才攒下并立让本事果然落地的工程化本领。

每一年咱们作念完一个东西,客户都会建议更高的要求。这内部积贮了极度多工程化落地的素养,尤其在大模子时期,极度蹙迫。

别的团队还在发愁「Demo怎么变家具」时,这谈坎,讯飞仍是趟了十几年。

而从语音到机器东谈主,看着是跨界,实则是吞并条路往深里走。

早些年,讯飞给机器东谈主装的是「嘴巴」和「耳朵」,贬责它怎么「能听会说」;

2022年的「超脑2030接头」,第一次把狡计定在让机器东谈主走进千门万户;

到今天,机器东谈主超脑平台仍是对外赋能了400多家企业。

听懂东谈主之后,下一关当然是读懂物理寰球。

带队的潘嘉,正是这条旅途的缩影。2009年进讯飞接头院,从语音识别作念起,拿过CHiME、OpenASR等外洋评测冠军,是国度科技高出一等奖的主要完成东谈主。

从语音到多模态再到具身大脑,换的是模态,不变的是那套把AI逼到能用的功夫。

不外光有积贮还不够,还得赶上趟。

AI这几年最大的变化,是从语音、翰墨这类「离身」的交互,转向让机器东谈主用身段走进物理寰球。

说白了,战场从屏幕里挪到了屏幕外。

对讯飞来说,这个转向来得正是时候。曩昔积贮的AI智商和工程化素养,刚好能用在新战场上。

到这里,整盘棋的单干就明晰了:讯飞出AI底座和产业资源,爻方专攻机器东谈主大脑,聆动通工具有最新升级的统一多模态具身大模子iFLYTEK-Embodied-Omni,并负责工业具身大脑-小脑-实践全链路。

至于这盘棋往哪下,聆动通用CEO季超对行业接下来两三年的判断,说得很直白:

成本会越来越垂青收入、订单、客户复购和形状回本周期。具身智能下一阶段不会只比谁讲得更广大,而是比谁能把机器东谈主果然送进工场,并让客户合手续付费。

新公司是新的,但这盘棋,讯飞其实仍是下了许多年。

One More Thing

对了,差点忘了个故意念念的事,这家公司为什么叫「爻方」?

潘嘉说,名字想了很久,临了是一位学形而上学的一又友起的。

「爻」出自《易经》,是卦象里阴阳变动的最小单位。

阴一半、阳一半,这未便是0和1嘛,号称中国最早的二进制。

好家伙,一家作念AI的公司,名字里尽然藏着几千年前的「代码」,故意念念。

而「方」,取的是「变中求方」,在纷纷幻化的寰球里,稳稳占住弹丸之地。

阴阳会变,方寸不乱。

放在具身智能这张还没东谈主摸到底牌的牌桌上,「变中求方」四字,倒像是提前写好的一句注脚。

论文地址:

https://arxiv.org/abs/2607.02542

— 完 —

量子位 QbitAI

热心咱们kaiyun平台登录入口,第一时辰获知前沿科技动态



相关资讯
热点资讯
  • 友情链接:

Powered by 开云·Kaiyun(中国)官方网站-科技股份有限公司 @2013-2022 RSS地图 HTML地图