過去幾年,世界動作模型(WAM)沿着一條清晰的路線演進:更大的數據、更深的推演、更強的預測。整個行業默認的假設是,智能的上限取決於規模。
酷哇科技在最新發佈的世界模型工作中,對這個假設提出了不同看法。他們的判斷是:當模型規模不再是主要約束,智能的瓶頸會轉移到認知資源的分配方式上——機械人在空曠道路和複雜路口消耗同樣的推演算力,這個被整個行業忽視的結構性問題,正在同時拖累性能與成本。
基於這一判斷,酷哇發佈了自適應想像世界模型 RISE,論文、代碼與數據集同步開源。這是繼 DAWN 交互式推理架構之後,他們在世界模型方向的第二項工作。兩項工作合在一起,可以看出這家公司對行業的三個思考。
思考一:推演深度不該是超參數,而該是決策。
現有 WAM 無論架構如何變化,都沿用全局固定的想像預算(Fixed Rollout Budget),推演深度由工程師預先設定。RISE 把這件事交還給模型:潛在評估器(Latent Evaluator)在每一步推演後評估已揭示的風險曲線與未來規劃增益,推演門控(Rollout Gate)實時權衡增益與算力成本,自行決定繼續思考還是立刻行動。推演的有效深度從人工設定變成一次次 Roll/Stop 決策的湧現結果。
消融實驗支撐了這個方向:1,248 個測試場景在零推演下表現最佳,強行加深反而拉低性能;另有 6,000 余個複雜路口場景依賴 3 幀以上的深層推演。固定的深度在任何一端都是錯的——行業為“一刀切”付出的代價,一直被算進延遲和硬件賬單裏,很少有人把它單獨拎出來看。
思考二:安全數據的缺口,真實世界補不齊。
具身智能行業對數據的討論集中在規模,但酷哇把注意力放在結構上:真實駕駛日誌記錄的幾乎都是安全通過的單一結局,safety-critical 的事故長尾天然缺失,而這個缺口靠多跑車補不齊——沒有公司會用事故換數據。他們的解法是 CounterDrive 反事實數據集:以真實場景起始幀為基礎,用 AIGC 大規模生成危險結局,再經專家驗證與人工標註,形成"真實-反事實"成對的監督信號。接入後,模型的危險識別 AUC 從 0.5 左右的盲猜水平提升至 0.93 以上。
這指向一個行業級判斷:未來機械人公司的數據競爭力,一半在真實場景的回收能力,一半在合成數據的因果質量。
思考三:調度模塊應該成為行業公共件。
RISE 的調度器被設計成獨立模塊,團隊以插件化方式將其接入前代 DAWN 架構,不改動 Predictor 與 Planner 的任何底層邏輯,DAWN 的 PDMS 即從 89.1 提升至 90.3。加上論文、代碼、數據集的全面開源,酷哇釋放的信號是:自適應調度不是某一家公司的私有技巧,而是所有 WAM 都可以復用的基礎能力。在 NAVSIM v1/v2 上,RISE 分別取得 91.5 PDMS 和 90.8 EPDMS,v2 九項細分指標中七項排名第一或並列第一。
從 DAWN 到 RISE,這條技術線的落點始終如一:讓機械人在真實城市環境中 24 小時穩定作業。酷哇把長時魯棒性視為具身智能的第一約束,而自適應算力調度是他們交出的第二份答案。這個世界模型該往哪裏走的問題,現在被擺到了枱面上。
酷哇科技(COOWA)成立於2015年,作為世界模型驅動的城市場景具身智能全棧商。公司深度聚焦智慧出行、市政環衛、智能製造、物業服務四大核心場景,構建了涵蓋輪式機械人、四足機器狗及泛人形機械人的多元化產品矩陣。酷哇始終堅持以技術創新推動具身智能從 Demo 走向規模化落地,致力於打造真正具備生產力價值的機械人。(記者 楊凌雲)