逆襲登頂!智元全模態大模型碾壓谷歌英偉達,拿下全球具身AI榜首

逛熱鬧的展廳,一群人圍在一起閒談,機器人站在人群中間,該如何分清嘈雜環境裡誰在呼喚自己?與人交談時,能抓住對方說話停頓的空隙順勢接話,被中途打斷後順暢銜接沒說完的內容,開口作答的同時,配合語氣做出抬手、點頭、淺笑的神態動作……這些普通人日常聊天再平常不過的細節,恰恰是過去人形機器人最難翻越的大山門窗

長久以來,機器人行業陷入了一個尷尬困局:視覺識別、語音轉文字、肢體運動每一項單獨拉出來都成績亮眼,可把看、聽、說、動整套動作連貫融合,復刻人類自然交流狀態,始終差著關鍵一截門窗。各個感知模組各自運轉,沒法在同一時間線上協同配合,互動生硬、反應遲緩成了所有商用機器人的通病。

2026年7月,這一行業短板迎來重大突破門窗。智元自研具身原生全模態大模型WITA-OmniPreview,拿下全球具身全模態理解權威榜單DailyOmni綜合第一名,85.21分的總分超越千問、Gemini、豆包、英偉達等一眾通用大模型廠商產品,八項細分評測裡六項斬獲榜首。一家深耕人形機器人本體的企業,反倒在全模態互動賽道跑贏了主流AI大廠,也為人形機器人走進家庭、工廠、線下服務場景打通了互動最後一關。

一、DailyOmni硬核大考:拼的不是看圖聽音門窗,是聲畫同步理解

市面上絕大多數AI大模型評測,大多停留在靜態圖文問答、短影片內容解讀層面,只需要AI看懂一張圖片、一段剪輯好的短片給出答案就行,適配的是手機、電腦上線上刷內容的場景門窗。但DailyOmni評測標準完全貼合機器人所處的真實物理世界,堪稱人形機器人互動能力的摸底大考。

這份榜單全程採用商場、展廳、居家等開放空間的原生音影片素材,環境裡充斥多人交談雜音、背景響動、連續發生的各類瑣事,核心考察三項硬核能力:精準匹配說話人與畫面聲源、理清整件事情發生的先後時序、結合畫面與聲音完成綜合推理門窗。簡單來講,就是考驗AI能不能身臨其境看懂、聽懂動態環境里正在發生的一切。

WITA-Omni交出的答卷足夠亮眼:音影片對齊、事件時序判斷、長影片理解、綜合推理等核心維度全線領跑門窗。最值得行業深思的一點是,榜單前列幾乎都是網際網路大廠打造的通用全模態模型,主打線上數字內容互動;唯有智元是純粹的具身智慧玩家,所有技術打磨都圍繞機器人面對面人機互動場景展開。

以往大家提起智元,最先想到的是可量產人形機器人整機、工廠作業機器人落地能力;這次登頂全球榜單意味著,智元早已不止是硬體製造商,底層AI大模型能力正式躋身全球第一梯隊,從造機器人身體,進階到打造適配物理世界的智慧大腦門窗

二、重構底層架構:摒棄流水線模式門窗,實現邊想邊說邊動

過去機器人交流生硬,根源在於老舊的序列流水線架構門窗。傳統互動流程是死板的先後順序:先收錄語音→解析文字語義→生成回答文字→合成人聲語音→最後下達指令調動肢體做出動作。一環傳遞給下一環,層層疊加延遲,資訊流轉中還會不斷丟失細節。

最終呈現出來的效果十分割裂:機器人聽完話要愣幾秒才開口,話說完半天,手勢和麵部表情才慢悠悠跟上;開心的語氣搭配緊繃的面部,講述內容時手部動作雜亂無章,全程充滿機器感門窗

WITA-Omni徹底推翻了這套序列邏輯,在經典Thinker-Talker雙模組基礎上新增Actor動作表情模組,搭建起三位一體同步執行架構,讓思考、說話、肢體表達三件事在同一時間軸並行推進門窗

Thinker作為核心推理中樞,把畫面、聲音、文字全部轉化為統一資訊維度,即時判斷當下該回應誰、何時開口;Talker流式輸出語音,隨時感知停頓、重音、情緒起伏;Actor模組不再是語音的附屬品,會跟著說話語速、語氣變化即時調動手臂動作、面部神態門窗

得益於跨流同步機制,機器人開口講話的瞬間,抬手、點頭、挑眉等動作同步啟動,語速放緩時肢體動作隨之舒緩,被人打斷講話可以立刻收住話語,待對方說完無縫接續前文門窗。理解、表達、動作不再是割裂步驟,而是融為一體的自然輸出,從根源上消解了機器人互動的遲鈍與割裂感。

三、千萬小時資料打磨門窗:讓機器人從真實對話裡學會聊天分寸

大模型比拼早已不再是單純堆砌引數,尤其面向具身互動的模型,高質量時序互動資料才是核心壁壘門窗。網路上公開的音影片素材大多沒有對話輪次、回應時機、肢體動作匹配標註,用這類資料訓練出的AI,永遠拿捏不好聊天節奏,分不清什麼時候該傾聽、什麼時候該發言。

為適配機器人互動需求,智元搭建了專屬分層資料訓練體系門窗。前期千萬小時級多模態資料打底,音影片聯合素材佔比四成,重點訓練聲畫對應與時序認知;音訊、視覺、文字素材合理配比,夯實視聽語言基礎。更關鍵的是,團隊自建了以人為核心的專屬互動資料集,收錄海量人與人、人與機器人面對面溝通畫面,完整標註對話切換節點、回應時機、手勢表情搭配邏輯。

除此之外,模型採用SFT監督微調、OPD同策略蒸餾、RL強化學習三段式後訓練流程門窗。強化學習階段設定多重獎勵標準,不僅要求回答內容準確,還會考核是否隨意插話、停頓把控、打斷銜接效果。日復一日訓練下來,AI不再只會機械作答,慢慢掌握了人際交往裡的分寸感:別人傾訴時安靜聆聽,對方短暫停頓適時接話,不會自顧自滔滔不絕。

四、全雙工對話領先:聊天節奏自然門窗,才算互動合格線

回答準確只是人機互動的基礎門檻,舒服的對話節奏,才是普通人感知最直觀的體驗門窗。為驗證語音互動硬實力,智元將WITA-Omni放在國際權威SpeechArena兩大語音基準裡測試,最終在音訊推理、全雙工對話兩項評測中拿下第一,成績超越GPT-Realtime等海外頂尖閉源語音模型。

全雙工對話能力,就是我們日常聊天“一邊聽一邊說”的狀態:交流過程中始終保持收音,既能即時接收對方話語,又能同步輸出自己的內容,靈活把控對話輪次門窗。很多大模型離線答題正確率很高,一旦進入即時對話場景短板盡顯:要麼不停搶話打斷對方,要麼過度沉默遲遲不回應,被打斷之後直接丟失上下文,對話徹底中斷。

WITA-Omni補齊了這塊短板:多人嘈雜環境裡精準鎖定專屬交談物件,過濾無關背景噪音;交談中途可以接收附和話語,調整自身表達節奏;突發打斷髮生時,快速記憶前文內容,自然延續話題門窗。放到線下門店接待、居家陪伴、展廳講解場景中,使用者不會覺得自己在和一臺機器對話,更像是和一位反應溫和、懂得傾聽的夥伴閒談。

五、三智一體成型門窗,具身智慧迎來落地新階段

一直以來,智元圍繞運動智慧、作業智慧、互動智慧打造完整技術版圖,也就是“三智一體”體系:運動智慧保障機器人順暢行走、靈活活動;作業智慧讓機器人能夠完成搬運、裝配等各類勞作任務;此次互動智慧登頂全球榜單,補齊了最後一塊拼圖,整套自研能力閉環徹底成型門窗

此前智元世界模型拿下WorldArena賽道冠軍,作業、運動基座模型早已批次搭載在量產工業機器人上;如今互動大腦迎來突破,三大智慧協同運轉,剛好契合2026年具身智慧行業從實驗室研發轉向線下規模化部署的大趨勢門窗

未來走進工廠車間,機器人可以聽懂工人指令、配合手勢協作幹活;入駐商場門店,能熱情接待顧客、答疑講解;走入普通家庭,陪伴老人閒談、協助打理日常瑣事門窗。衡量人形機器人優劣的標準,早已不再是單項技術引數高低,而是整體協同帶來的自然體驗。WITA-Omni的突破,不止是一次榜單上的勝利,更讓機器人真正融入普通人生活,邁出了堅實的一大步。

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://yxd-1688.com/post/60356.html

🌐 /