《每月發放黑科技,美帝要制裁我?》第291章 智能語音助手全面轉向深度學習路線?(2)

作者:短暫的狂歡·13天前

“資料量不夠,模型太淺。”周牧野推了推眼鏡,語氣裡帶著研究者特有的執拗。

“我們現在的聲學模型還是基於傳統G-H框架,語義理解更是靠規則模板硬套。想要實現您說的那種像人一樣對話的效果,沒有海量語料訓練,根本做不到。

而且計算量太大,以現在手機處理器的效能,本地跑深度學習模型幾乎不可能。如果全部走雲端,延遲和網路穩定性又是大問題。”

“模型框架,全面轉向深度學習路線。”

周牧野一愣:“深度學習?語音領域現在主流還是…”

“我知道現在主流是什麼,但我要的不是主流,是領先。我給你三個目標引數,你記好。”

周牧野連忙掏出筆記本。

“第一,聲學模型放棄G-H,上深度神經網路,用DNN-H混合框架做過渡,最終目標是完全的端到端識別。訓練語料我來解決,年底前我給你弄到十萬小時以上的標註語音資料。”

“十萬小時?”周牧野手一抖,國內目前公開的語音語料庫加起來恐怕都沒有一萬小時。

“第二,語義理解不要再用規則模板了,上意圖識別加槽位填充的聯合模型。我要它能理解上下文,支援至少三輪以上的連續對話,並且能記住對話過程中的關鍵資訊。

比如使用者先說幫我訂明天去北京的票,接著問那邊天氣怎麼樣,再然後說幫我帶件厚外套,它要知道那邊指的是北京。明天這個日期要延續到訂酒店、查天氣、提醒穿衣這一系列動作裡。”

周牧野嚥了口唾沫,只覺得頭皮發麻。

這種程度的上下文關聯,就是國際最頂尖的實驗室也還在論文階段。

“第三,本地算力不夠,就從演算法端壓縮。量化、剪枝、知識蒸餾,這些手段全用上。同時,藍芯微電子那邊正在研發下一代應用處理器,我會讓他們在晶片裡整合一顆專用的神經網路加速單元,專門跑語音模型。

但在晶片出來之前,你們先用軟體方案扛著,目標是把模型壓縮到能在現有旗艦機上本地執行基礎指令識別,複雜語義走雲端,端到端延遲控制在三百毫秒以內。”

三百毫秒。周牧野在心裡默唸這個數字,這意味著從使用者說完話到系統給出反饋,要在零點三秒內完成,幾乎要達到人類對話的無感延遲。

“林總,這…”周牧野張了張嘴,想說這幾乎是不可能完成的任務。

但林辰那雙眼睛看著他,平靜得像一潭深水,卻又帶著某種讓人無法質疑的魔力。

“周總監,我立項的時候說過,天音專案不是要做一個玩具,不是要做一個只能設鬧鐘查天氣的噱頭。我要的是下一代人機互動的入口。

明年,深藍系統的裝機量很可能會突破五千萬,後年可能會過億。當用戶習慣了動嘴不動手,誰掌握了語音入口,誰就掌握了移動網際網路的下一個時代。”

他伸手拍了拍周牧野的肩膀:“技術路徑你不用擔心,按我說的方向走,該突破的瓶頸,會在該突破的時候突破。你現在要做的,就是把團隊擴到一百人以上,分三個小組並行,聲學組、語義組、工程組。錢管夠,人管夠,我只看結果。”

周牧野看著林辰,忽然想起自己入職那天,林辰在辦公室裡對他說的話:“跟著我,你會做出改變世界的產品。”

當時他覺得這年輕人狂妄。

但現在,看著這個比自己小了將近十歲的男人,他莫名其妙地覺得…也許真能做到。

“明白,林總。我等會就改技術路線圖。”

猜你喜歡

同題材或同分類的其他作品。