「我一直覺得「瑕疵」是人類所剩不多的辨識關鍵,但這種瑕疵也漸漸的被AI一個一個的學走,而且時間也真的沒有過多久。」
昨天參加會議的時候老師在台上用了GPT 5.6 Sol (應該是這個吧?) 的語音模型給大家看看。當時我真的起雞皮疙瘩了。以前在說AI的新發展有多厲害的時候,我也是看了看然後覺得哦真的好厲害,不過昨天真的是我第一次快要分不出來在背後的到底是人還是機器,真的沒想過「聲音」、「對話」也會有恐怖谷效應出現。
我原本預期的新功能就是「打斷」、多一些「語助詞」再加上停頓等等。能做到這些我已經覺得很厲害、很震驚了,因為在對話途中真的可以打斷,模型也會停頓,說一些像是「等等」、「給我一點時間」之類的話;不過讓我最害怕的是他的「口音」,以往我們聽這些模型講話的時候,他們說出來的基本上都是「標準的」語言,比如說中文就會是字正腔圓的「北京腔」or「沒有瑕疵」的發音,然而昨天的模型卻是那種,上課同學講話「口齒不清」的樣子(有種捲舌沒捲好然後含滷蛋的感覺)。我一直覺得「瑕疵」是人類所剩不多的辨識關鍵,但這種瑕疵也漸漸的被AI一個一個的學走,而且時間也真的沒有過多久。
我記得當初考語言所口試的時候,其中一位老師問了我「你覺得人類跟AI有什麼不一樣嗎?」我停頓了7-8秒後回他「好像…沒什麼差別?」或許,在「資料」以及「載體」都充足的情況下,我們真的沒什麼不一樣吧?