環(huán)球觀察：實(shí)際使用感受如何？來看看這份《人工智能大模型體驗(yàn)報(bào)告》

來源：經(jīng)濟(jì)參考網(wǎng)時(shí)間：2023-06-01 21:20:53

近年來，人工智能技術(shù)迎來了新一輪大變革，其中由OpenAI開發(fā)的ChatGPT在推出短短2個(gè)月后便成為了月活破億的應(yīng)用。隨著海外科技巨頭微軟、谷歌、Meta等加大投入，國內(nèi)科技企業(yè)如百度、華為、阿里等紛紛布局，人工智能大模型的發(fā)展日新月異。

為直觀感受我國當(dāng)前主流科技企業(yè)所推出的大模型產(chǎn)品的現(xiàn)狀、優(yōu)勢和特點(diǎn)，新華社研究院中國企業(yè)發(fā)展研究中心于今年4月啟動(dòng)了人工智能產(chǎn)業(yè)創(chuàng)新活力研究。本次研究設(shè)置了用戶體驗(yàn)項(xiàng)目，抓取了05月22日—05月26日數(shù)據(jù)，通過人機(jī)互動(dòng)提問等形式，對國內(nèi)主流大模型進(jìn)行使用體驗(yàn)評測，旨在為科技企業(yè)調(diào)整努力方向提供參考。

【資料圖】

在綜合指數(shù)評價(jià)方面，本次評測選取4大維度（基礎(chǔ)能力、智商測試、情商測試、工作提效能力）、36個(gè)子能力，共300個(gè)問題，對目前主流大模型產(chǎn)品進(jìn)行測試，并邀請相關(guān)專家組成評測團(tuán)隊(duì)深入分析各個(gè)產(chǎn)品的語義理解、知識儲備、邏輯能力等，最終得出各廠商的大模型綜合指數(shù)評價(jià)。

在評價(jià)規(guī)則上，課題組以各個(gè)大模型對參與測評的題目回答完成度，進(jìn)行了綜合考量，其中評測規(guī)則分為：答案較為完美，內(nèi)容可在實(shí)際場景中直接使用；基本可用，可在實(shí)際場景中使用；調(diào)整可用，但需人工進(jìn)行調(diào)整后方可使用；大略可用，需要較多人工調(diào)整方可使用；不可用，答非所問、語言不通等五個(gè)層級。

注：基于評測條件、評測時(shí)間等限制，本次評測結(jié)果存在一定主觀性，未來將進(jìn)一步優(yōu)化完善評測模型，提供更精確結(jié)果。

通過圍繞四個(gè)維度的綜合測試，課題組發(fā)現(xiàn)，由OpenAI開發(fā)的Chat-GPT系列模型各項(xiàng)指標(biāo)表現(xiàn)優(yōu)異，且Chat-GPT4.0版本各項(xiàng)能力在3.5版本的基礎(chǔ)上均有一定程度提升。而由百度開發(fā)的人工智能大模型文心一言表現(xiàn)較為搶眼，是目前國內(nèi)自主研發(fā)的大模型中具有優(yōu)勢的產(chǎn)品。其余大模型產(chǎn)品也在基礎(chǔ)能力方面表現(xiàn)優(yōu)良，但面對較復(fù)雜的工作內(nèi)容或情商環(huán)境仍有不同程度的進(jìn)步空間。

針對各維度能力測評，該報(bào)告還給出了相應(yīng)的案例展示和分析。

在基礎(chǔ)能力部分，百度文心一言表現(xiàn)最為搶眼，訊飛星火、阿里巴巴通義千問、智譜ChatGLM表現(xiàn)優(yōu)良；商湯商量、Vicuna-13B表現(xiàn)尚佳。

在智商測試部分，百度文心一言在該環(huán)節(jié)意外超過ChatGPT3.5，表現(xiàn)突出，阿里巴巴通義千問分?jǐn)?shù)接近GPT3.5，商湯商量、訊飛星火、智譜ChatGLM表現(xiàn)尚佳；Vicuna-13B表現(xiàn)有待改進(jìn)。

在情商測試部分，百度文心一言表現(xiàn)最佳；阿里巴巴通義千問與訊飛星火表現(xiàn)優(yōu)良；商湯商量、智譜ChatGLM表現(xiàn)尚可；Vicuna-13B表現(xiàn)一般。

在工作提效部分，百度文心一言與智譜ChatGLM最佳，訊飛星火次之；阿里巴巴通義千問及Vicuna-13B表現(xiàn)尚可；商湯商量表現(xiàn)一般。

研究發(fā)現(xiàn)，人工智能與各行業(yè)的深度融合是促進(jìn)產(chǎn)業(yè)升級和轉(zhuǎn)型的重要方式之一，“大模型+行業(yè)”的發(fā)展應(yīng)用尤為重要。目前大模型在金融、工業(yè)、醫(yī)療等領(lǐng)域已經(jīng)取得了顯著的成果，如何為行業(yè)領(lǐng)域提供更為精準(zhǔn)、更為高效的解決方案，成為大模型廠商未來彎道超車的機(jī)會(huì)。

報(bào)告指出，隨著人工智能的地位和作用越來越重要，政府、企業(yè)和社會(huì)需要共同努力，各大廠商應(yīng)投入更多資源，頭部企業(yè)可以持續(xù)發(fā)力自研大模型，而專注于解決方案的行業(yè)廠商可以考慮通過深耕行業(yè)來彰顯特色。

研判該報(bào)告的測評結(jié)果，浙江大學(xué)國際聯(lián)合商學(xué)院數(shù)字經(jīng)濟(jì)與金融創(chuàng)新研究中心聯(lián)席主任、研究員盤和林建議，國內(nèi)大模型發(fā)展應(yīng)從兩方面著力，一方面是大語言模型，中文并非ChatGPT的強(qiáng)項(xiàng)，OpenAI主業(yè)在英語，所以中文大語言模型對于中國市場還是有發(fā)展空間的；另一方面則是在細(xì)分領(lǐng)域應(yīng)用，比如編程、專業(yè)知識問答、中文PPT制作等，這些細(xì)分的功能領(lǐng)域才是未來大模型真正需要關(guān)注的領(lǐng)域，也是從單個(gè)應(yīng)用轉(zhuǎn)變?yōu)樯鷳B(tài)應(yīng)用的關(guān)鍵。

掃碼查看

AI大模型體驗(yàn)報(bào)告

↓↓↓

標(biāo)簽：

責(zé)任編輯：FD31

上一篇：容匯鋰業(yè)6月8日深交所首發(fā)上會(huì) 擬募資30.6億元

下一篇：最后一頁