AI語音已逐步滲透到了大眾的生活中,但是刻板的對話方式似乎還困擾著廣大用戶。
全雙工這個概念對人工智能行業(yè)從業(yè)者來講,并不陌生。談到全雙工,此前,谷歌Duplex幫助人們通過電話預約餐廳和理發(fā)師的功能,帶來了有趣的觀感體驗,在I/O 2019上,谷歌宣布對Duplex進行重大擴展。
谷歌Duplex
在推進對話交互智能的市場化應用過程中,思必馳同樣發(fā)現,自然流暢的對話體驗、類人化的交互體驗成為了絕對的剛需。
因此,具備以上兩個特點的全雙工語音交互技術,成為了關注的焦點。思必馳聯合創(chuàng)始人、首席科學家俞凱,早在劍橋大學期間主導開發(fā)了全雙工口語對話系統,2010年參加國際對話系統研究挑戰(zhàn)賽時,獲得可控測試的冠軍,這也是世界上最早的全雙工端到端口語對話系統之一。區(qū)別在于,與現在廣泛作用于物聯網智能終端設備的全雙工交互系統相比,當時的主要應用,在基于電話信道的人機交互方面。
全雙工是個系統工程
作為系統工程,全雙工需要綜合利用語音語言技術的各個模塊,實現前后聯動,例如,其對前端信號處理、AEC回聲消除有強相關依賴,實時上傳的音頻對噪聲處理、音頻音質要求較高,同時,作為系統工程,全雙工涉及到全鏈路語音交互的各個模塊,其同樣需要對識別后的識別信息、語義信息等進行綜合判斷及處理,并做出決策。
半雙工&全雙工
因此,全雙工交互技術的提升涉及到對話系統的各個模塊,不僅各個模塊的功能需要提升,模塊間的配合能力更需要完善。
思必馳在推進全雙工交互技術的市場落地過程中,發(fā)現了一個更有效的事情,“全雙工+語義拒識”讓交互體驗更加優(yōu)化。全雙工固然重要,但語義拒識算法,卻往往容易被人忽視。
語義拒識算法
受限于語音技術的發(fā)展,現有的對話系統受噪聲條件的影響非常明顯,缺乏穩(wěn)健性。在對話系統中,說話人的檢測和基于語義的拒識是其非常重要的組成部分。當說話人的語音模糊不清或者語音數據不在已有訓練集合中時,識別系統會產生識別錯誤,從而影響對話系統的識別和理解效果。
在半雙工狀態(tài)下,環(huán)境噪聲以及周圍人聲容易引起無效輸入,對話系統或錯誤響應,或給出“沒聽懂”的呆板播報,并且播報時不能打斷,十分影響交互效率。全雙工狀態(tài)下,對無實際語義的輸入則不會給出響應。
拒識算法主要目的是去除沒有語義意義的音頻片段,節(jié)省后端處理的計算資源,提高整個對話系統的交互魯棒性,提升用戶使用體驗,避免錯誤的語義理解引發(fā)錯誤的反饋到用戶端。
思必馳語義拒識算法
思必馳拒識算法能夠解決的很多噪聲和無語義意義的問題,例如用戶無意義的嗯啊聲、背景噪聲與閑聊聲、純音樂聲、聲音幅度小、各種笑聲尖叫聲,無厘頭聲音等。
語義拒識對全雙工對話交互而言至關重要,可以說,拒識做不好,全雙工的效果往往也會差強人意。
思必馳全雙工交互技術,更強的持續(xù)對話能力
思必馳全雙工交互技術,讓更流暢的多輪對話成為常態(tài),說法更自由。
l連續(xù)交互免喚醒
過去,半雙工狀態(tài)下,用戶的跨領域交互每次交互都需要重新喚醒,于是,免喚醒技術成為改善體驗的焦點。近些年,免喚醒技術已不是新鮮方案,有的采用“便捷喚醒詞定制”,有的采用“喚醒+識別理解一體化”方案,但都存在著諸如“漏字”這類一系列的風險:
“你好小馳明天天氣如何?”
漏字通常出現在喚醒詞和后面識別文本連接的地方,也就是句子中段。當系統在識別過程中漏掉“明”字時,就會造成時間信息不清晰(“明天”還是“今天”?),系統無法明確用戶的真正時間指令。而現在,思必馳全雙工技術方案可實現一次喚醒,在多個領域持續(xù)交互,跨領域指代消解。
l動態(tài)斷句
在日常生活中,很多用戶說話會出現拖音現象,說話過程中,有思考/間斷的過程,因此會出現很多半截句,簡單粗暴的調整語音端點檢測閾值的做法往往會帶來對話卡頓的現象。
半雙工狀態(tài)下,對話系統設定了固定的停頓檢測時間,用戶還未表達完整句子稍微一猶豫/停頓,會被語音端點檢測系統誤斷句,造成輸入內容不完整,機器無法理解。
思必馳全雙工交互技術則在云端根據用戶說話節(jié)奏和內容,忽略無意義噪聲,動態(tài)斷句,既能保證用戶輸入的完整性,又能保證較快的響應速度。在回復方面,則可以適時的回復“嗯”等接話話術,系統打破了對用戶說話規(guī)則的要求,用戶可以按照自身的說話習慣來進行交流,交互過程更加人性化。
l語義打斷,避免誤打斷
在半雙工狀態(tài)下,語音合成播放時很難進行打斷,在一些終端設備上,行業(yè)內普遍采用的打斷方式是“快捷喚醒詞打斷”,說法十分固定,無法泛化,需要定制多個喚醒詞,當用戶想打斷的時候,必須要重復喚醒詞,容易發(fā)生誤打斷。同時,對話打斷對環(huán)境有較高要求,在有噪聲的時候,也容易被誤打斷。
思必馳全雙工交互技術可在對話的過程中,實時語義打斷,不容易出現誤打斷,同時,對沒有語義的輸入,則不會打斷語音合成播放。
這一技術在智能客服的領域將會大大改善消費者的體驗,消費者可以隨時隨刻打斷機器人客服的無效對話信息,進行信息咨詢。
如何判斷什么時候接話,什么時候反問,機器需要有智能決策的能力,這也是思必馳全雙工技術的一大特性:主動交互。根據用戶表達狀態(tài),如“正常說話”、“主動沉默”、“無意義表達”等狀態(tài),來給予相應的主動反饋。
思必馳全雙工交互技術支持智能判斷,尤其是能夠主動打斷用戶的復雜冗長表達,主動打破沉默僵局,實現流暢自然的用戶口語交流習慣。當識別到用戶正常表達時,機器等待說完后答復反饋;當用戶大段無意義輸入或表達過于復雜時,會主動打斷并提示反問;在交互過程中,當用戶沉默時,則可以主動發(fā)起對話交互。
同時,經過反復打磨和優(yōu)化,該技術對系統功耗幾乎無影響,實現低功耗下的最優(yōu)質體驗。
思必馳全雙工語音交互
實踐,是檢驗真理的唯一標準
目前,思必馳全雙工交互技術已展開全線方案滲透,包括AIOT方案和企業(yè)信息智能服務,深入作用汽車、家居、電子、教育、醫(yī)療、政務、金融、物流、酒店等場景。以音箱方案為例,接入全雙工系統后,這款“智能助理設備終端”將更似真人助理,更具備人類親和力的特質和邏輯思維能力,整個對話體驗更加自然流暢。
思必馳業(yè)務場景
云端全雙工中控大腦持續(xù)優(yōu)化
針對全雙工交互技術,思必馳將持續(xù)優(yōu)化云端全雙工中控大腦,持續(xù)進行策略優(yōu)化、場景優(yōu)化、單點技術模塊優(yōu)化,將交互體驗做的更好。
未來,多模態(tài)交互將會讓全雙工交互技術發(fā)揮更大的能量,配合聲紋識別、圖像處理、虹膜識別等技術,過濾無用信息,人機交互會變得更加貼合人性,或許不遠的未來,你甚至分不清與你隔屏對話的,到底是人還是機器人。
申請創(chuàng)業(yè)報道,分享創(chuàng)業(yè)好點子。點擊此處,共同探討創(chuàng)業(yè)新機遇!
2023年7月6日,第六屆世界人工智能大會(WAIC2023)在上海開幕,“人工智能大模型”是本屆大會的備受矚目的話題,據悉,在昇騰AI大模型的創(chuàng)新研發(fā)中,華為聯手26家行業(yè)領軍企業(yè),組建了一支協同創(chuàng)新的“AI明星隊”,云天勵飛作為中國人工智能企業(yè)的杰出代表,和互聯網大廠、運營商、科研院所等優(yōu)秀團隊
這幾個月來,以ChatGPT為代表的生成式AI展現出的能力令世界驚嘆。自從2016年AlphaGo戰(zhàn)勝李世石掀起了一波AI浪潮后,AI仿佛已經沉寂了很久,ChatGPT的橫空出世就如同一束耀眼的光芒,讓AI這個名詞重回C位。過去在AI1.0時代,主要通過訓練模型來實現圖像識別、聲音識別、語言處理等特
文:互聯網江湖作者:志剛2023年的IoT需要一個新故事。6月29日,涂鴉智能在開發(fā)者大會上,發(fā)布了企業(yè)級戰(zhàn)略PaaS2.0,希望通過一個平臺+四大開發(fā)服務,建立起IoT生態(tài)。對于這場發(fā)布會,市場的態(tài)度是積極的。美東時間6月29日收盤,涂鴉智能美股股價上漲5.6%,來到1.87美元/股。近日股價穩(wěn)定
美團曾經的二號人物王慧文對標OpenAI的創(chuàng)業(yè)項目光年之外,以20億賣給美團,再度引發(fā)市場對大模型的熱議。
2020年底,王慧文在朋友圈寫下這句話時,外界本以為這位伴隨中國互聯網發(fā)展而持續(xù)創(chuàng)業(yè)20年的人物即將告別創(chuàng)業(yè)舞臺。但是,一個曾經多次創(chuàng)業(yè),正值壯年的互聯網老將心中的創(chuàng)業(yè)熱情是難以熄滅的。
文/道哥美國設計軟件公司Figma近期在紐約證券交易所掛牌上市,首日即上演“狂飆”行情——發(fā)行價定每股33美元,開盤報價85美元,較發(fā)行價翻倍。首日收報115.50美元,較發(fā)行價大漲約250%,市值飆升至近670億美元,創(chuàng)下近30年來同等規(guī)模美股IPO的最大單日漲幅紀錄。然而,隨著短線資金獲利了結,
8月16日,盧松松非常榮幸的成為了一名《2025世界人形機器人運動會》的觀眾。這是一場超酷的機器人運動會,也是人類給機器人辦的第一屆奧運會,來自16個國家的280支隊伍會參加500多個比賽項目??戳艘惶斓谋荣?,晚上就回來寫文章,編輯短視頻。先說感悟:(1)這是人類首次給機器人辦的第一屆運動會,史無前
文/一燈來源/節(jié)點財經在當前無人敢缺席的AI軍備競賽中,巨頭們一面為巨額的資本支出焦慮,一面又向市場勾勒著未來的宏偉藍圖。在各家動輒千億級投入的背景下,市場迫切需要一份關于AI回報價值的有力證明。而騰訊,率先給出了答卷。8月13日,騰訊控股發(fā)布2025年第二季度財報。盡管資本開支同比劇增119%,達
文/二風來源/節(jié)點財經2025年的硅谷,一場沒有硝煙的戰(zhàn)爭正以前所未有的烈度上演。這場戰(zhàn)爭的核心武器不是代碼或芯片,而是人——那些全球僅有數千名、能夠構建未來人工智能基礎模型的頂尖大腦。在這場激烈的人才爭奪戰(zhàn)中,Meta及其首席執(zhí)行官馬克·扎克伯格(MarkZuckerberg)正扮演著最具侵略性的
Manus撕開一道真相
文/八真來源/節(jié)點財經具身智能賽道,誰最有可能拔得A股資本市場的頭籌?答案大概率是誕生剛剛兩年,由華為"天才少年"、B站百萬粉絲科技UP主稚暉君(彭志輝)創(chuàng)立的智元機器人。近期,從事新材料研發(fā)與生產的上緯新材(688585.SH)丟出重磅炸彈,宣布智元機器人及相關主體將通過收購其至少63.62%的股
文/道哥大舉裁員、清空賬號、國內IP無法訪問——曾被譽為“中國AIAgent希望之星”的Manus,在估值飆至5億美元的高光時刻“閃離”中國市場。近日,Manus“裁員、出走”的消息在媒體端大量發(fā)酵。消息稱,Manus公司總部將由中國遷至新加坡,其國內團隊也將大幅裁撤——原有120人規(guī)模團隊除40余