15分鐘訪完十萬人,台灣金融、民調業也搶進!AI受訪者爆紅,市調巨頭為何仍要找真人?

15分鐘訪完十萬人,台灣金融、民調業也搶進!AI受訪者爆紅,市調巨頭為何仍要找真人?
傳統市調流程曠日費時,但「AI受訪者」能減少市調時間、成為極難招募的受眾,因此大受歡迎。圖片來源:Shutterstock
2026-09-04
採訪、撰文・詹湘淇
104
美國藥局巨頭CVS Health想知道,為什麼有些病患沒有按時回診領藥。

過去,研究團隊得花四到六週招募病患、安排焦點訪談,再逐一追問:是忘記了、不相信醫生,還是曾有不好的領藥經驗?現在,團隊只花15到30分鐘,就能直接向超過十萬個「虛擬病患」提問。

這些病患是由AI建立的「代理分身」。CVS企業顧客體驗與洞察副總裁納拉辛漢(Sri Narasimhan)表示,系統不只預測病患會不會領藥,還能繼續追問他們「為什麼這樣做」。

根據CVS內部對照,AI模擬與傳統真人研究的吻合度約達85%至95%。當真人受訪者愈來愈難招募,企業等不起曠日費時的傳統市調流程,AI提供了一條更快的路。

八成市調人員準備進場,AI受訪者為何爆紅?

AI可以根據人口普查、金融交易、地點造訪等真實世界資料,學習人類年齡、工作、收入等特徵之間的關聯,藉此生成大量虛擬受眾,模擬不同人群的決策偏好。更進一步的「數位孿生」技術,則先蒐集特定真人的問卷、深度訪談與行為紀錄,再讓AI預測本人遇到新問題時的反應。

這項技術能迅速獲得市場青睞,關鍵在於它解決了傳統市調的兩大痛點。

第一,將數月的測試壓縮至幾分鐘,實現極速迭代。

科技新創Aaru只花一天生成3,600位虛擬投資人,就重測了安永(Ernst & Young)耗時半年才完成的全球財富調查,而且產出結果和原始調查的相關性超過90%。

不會疲勞、不會拒答的AI受訪者,也能同時比較數十種包裝、價格和文案。產品一改,只要幾分鐘就能重測,企業可以先用AI淘汰明顯不受歡迎的方案,再把最後幾個選項交給真人。

高露潔(Colgate)與數據團隊PyMC Labs合作,把57款護理產品丟進AI模型,預測消費者的購買反應,結果與真人實測的吻合度高達九成,兩者一致發現青少年比退休族更願意嘗試芒果口味牙膏。

第二,突破傳統訪談邊界,觸及極難招募的受眾。

除了排序消費者偏好,虛擬受訪者還能進行深度訪談、追問選擇原因,找出產品的甜蜜點。新創公司Evidenza更主打能靠AI模擬過去難以觸及的受訪者,例如CEO、大型企業決策者等B2B客戶。

這項技術已經正式進入全球市場調查產業。哥倫比亞商學院和市場研究顧問GBK Collective調查發現,81%市調人員已經或計劃使用AI生成的模擬調查數據;超過四成已在試驗數位孿生,模擬客戶在不同情境下的購買行為、點擊率和互動模式。

主打AI模擬調查的新創備受矚目,資本也跟著進場。Aaru成立短短九個月就衝上十億美元(約新台幣317億元)估值,拿下麥當勞、可口可樂、拜耳、波士頓啤酒公司、A24等大型企業客戶。

史丹佛大學人本人工智慧研究中心(HAI)團隊成立的Simile,也獲得AI教母李飛飛、OpenAI共同創辦人卡帕西(Andrej Karpathy)投資,並與市調巨頭蓋洛普(Gallup)展開合作,研究虛擬分身技術的應用可能。

AI選民、消費者上線,台灣團隊試水溫

回到台灣,也有不同領域的團隊分頭展開嘗試。

金融業工程師孫甫璋發現,銀行每推出一項新的金融商品,前期至少要花兩週做焦點訪談,光訪一輪就燒掉新台幣30至50萬元;但只要一調整利率、保額或回饋率,幾乎等於前功盡棄。

於是他靈機一動,找了法遵與行政同事,花了兩週開發出一套低成本的前測流程,可以在90秒內生成30個AI受訪者,模擬不同族群對微型信貸方案的接受度,直接從回答歸納出行動建議,「如果這項產品要上線,該在什麼時候推出、怎麼推出、需不需要聯名,我們都可以產出完整的洞察報告。」

這套概念驗證起初只在內部黑客松發表,又一路走上台灣人工智慧學校的Claude Code Demo Showcase,在更多開發者面前現場展示。

AI虛擬受訪者-金融業-前測-微型信貸-概念驗證-市場調查台灣金融業團隊自主開發前測流程,能快速生成多位AI受訪者,模擬不同族群對金融商品的接受度。圖片來源:孫甫璋提供

台灣民調業者也展開動作。今年八月,台灣議題研究中心(TPOC)正式發表「矽基樣本」實驗結果,讓AI對民調題目或政治議題表態。

「我們從來沒有辦過一場講座是學術界、教育界來賓大於60%的,」看見現場人潮,台灣議題研究中心研發總監趙玉娟很訝異。除了民調同業,台下還坐滿政治學、統計學者、大數據專家和公部門人士,眾人都好奇台灣民調業者會如何使用這項新興技術。

為了貼近台灣社會,TPOC以過去26年的民調資料、歷屆縣市長選舉結果對照真實人口結構,設定了28種人物屬性,從年齡、性別、教育程度,一路延伸到政治傾向、媒體使用習慣,以及成長過程經歷的政治事件,一次生成3,000個虛擬受訪者。

有了這些背景條件,這3,000位AI還得每天看新聞、滑社群。團隊依照各年齡層慣用的社群媒體,餵入每日輿情動態,觀測AI在不同時事情境下的看法。

例如,當兒虐案件爆發時,可以模擬事件首次曝光、主管機關公開道歉、各方陣營施壓下的民調反應,由此評估對政治人物選情的衝擊。

TPOC-矽基樣本-AI民調-虛擬受訪者-台灣議題研究中心TPOC台灣議題研究中心發表矽基樣本實驗成果,利用AI模擬民調意向。圖片來源:詹湘淇攝

TPOC將矽基樣本的民調結果對照《美麗島電子報》、TVBS民調中心的真人電訪調查,結果平均誤差只有4.56個百分點。團隊已於今年九月開放訂閱制服務,單題測驗收費新台幣100元。

人設太理想、有偏見,AI回答仍有侷限

不過,AI模擬出來的調查結果,真的能還原真實人類的判斷嗎?

「近來大量研究公司搶著推出相關產品,但很多方案其實還沒充分優化,」尼爾森策略分析與洞察部門副總裁萊萬蒂(Martin Levanti)撰文指出,LLM非常擅長生成「看起來合理、很有說服力」的答案,但這些答案不一定真的準確可靠。

趙玉娟為TPOC測試矽基樣本時,也觀察到AI的判斷往往太過理性、正面。例如,超過八成AI受訪者「願意不惜一切捍衛國防」;收到未證實資訊時,甚至有九成六選擇主動求證、冷靜觀望。

「Agent有點太天使了,」趙玉娟坦言,TPOC團隊只能把恐懼、自私等人性弱點設為參數,甚至餵入社群媒體上的情緒化謾罵語料,避免AI過度迎合社會期待。

台大經濟系副教授馮勃翰也發現AI的立場普遍中庸。他曾讓學生設計實驗問卷,調查AI對盜版漫畫的態度,結果回答高度集中在中間選項,幾乎不會表達「非常喜歡」或「非常不喜歡」的極端立場,難以還原真人的強烈偏好。

德州大學奧斯汀分校政府系副教授林澤民解釋,AI開發商往往會抑制模型的攻擊性、爭議性言論,傾向迎合使用者的預設立場,回答也容易變得鄉愿。

AI還可能放大刻板印象。趙玉娟發現,35至54歲常被模型塑造成最堅定、最冷靜、最負責的年齡層,AI也常預設高學歷者習慣理性查證,年長者比較保守猶豫。

「如果過度依賴AI,這些偏見可能會不知不覺滲入我們的決策過程,」紐倫堡市場決策研究所人機互動小組負責人凱澤(Carolin Kaiser)示警,在商業決策中,早期使用者和小眾市場往往是創新的驅動力,AI的刻板印象卻常忽略這些群體的意見;若是觸及政治敏感領域,還可能左右公眾輿論、加劇現有的不平等現象。

真人驗證依然關鍵,傳統市調如何守住信任?

種種限制在前,不論是AI新創或傳統市調機構,都把AI受訪者定位為前期工具,不宜全面取代真人調查。

AI市場研究新創Synthetic Users強調,AI受訪者只能協助企業預先理解問題、調整訪綱、決定如何分配預算,如果要驗證結果、處理極端案例,還是需要訪問真實使用者。

傳統民調機構對真人驗證的要求更嚴格。「最好的合成模型,起點與終點都是真人提供的消費資料,」尼爾森指出,要強化AI受訪者的可信度,有三個基本前提:經過真人資料反覆驗證、使用最新且細緻的消費資料,並將AI結果放回真實市場資料中比較。

皮爾森數據營運長羅棋駿認為,企業需要建立一套可重複驗證的基準,確認模型在哪些族群、題型與情境下經過測試,又在哪些地方容易失準。但就算回測也有邊界,「我今天討厭你,不代表我明天也討厭你。」

拿過去的真人資料測AI,可以知道模型能否重現已發生的結果,卻不能證明下一次預測也會正確。因此,即便蓋洛普測試出的AI模擬結果已相當接近真人,也不敢宣稱「驗證成功」,反而繼續研究AI的有效範圍和失效邊界,除非有充分證據,才會考慮更廣泛的應用。

從極速探索到嚴謹驗證,目前業界的共識逐漸明朗:AI受訪者是很好的前期篩選與趨勢探索工具,但關鍵的最終決策,依然離不開真人的實測與驗證。

延伸閱讀

其他人也在看

你可能有興趣

已成功複製連結