三個 AI 系統回答了同樣的 106 條個人理財問題。單看事實準確度,它們幾乎並駕齊驅——五分制之下分別是 3.99、3.72 和 3.65,差距約三分之一分。但當評分者要挑出「哪個答案我真正想要」,其中一個被選中的次數,接近另外兩個的三倍。
有趣的正是這道落差。既然三者答得同樣正確,勝出的那個就不是靠「答得對」贏。下一個直覺猜測是它寫得比較好——但表達力恰恰是三者最接近的一項,其中一組對比的差距甚至未達統計顯著。
那麼被獎勵的,究竟是什麼?是第三種特質。MoneyBench 研究報告(全文為英文)對它的定義異常精準:一個有用的答案,是能夠支撐它所回應的那個決定——它指出與問題相關的數字、說明這些數字如何互相作用,並講清楚它們對眼前這個選擇意味著什麼。
聽起來很溫和,實際上卻是全部分野所在——而且一旦你看得見它,就可以用它來檢驗任何一個 AI 給你的理財答案。
這是三篇系列的第二篇。第一篇講述這場測試如何設計、以及發現了什麼。
一個答案可以擅長的三件事
MoneyBench 為每個答案在三個獨立維度上評分,各為 1 至 5 分,而權重在任何評分開始之前就已經固定——準確度 0.45、有用度 0.35、表達力 0.20。事先訂好權重很重要:它杜絕了看見結果之後,再去找出一條「剛好會贏」的公式。
用日常語言講,三個維度是:
準確度——事實對不對?供款上限是不是真正的上限,稅務處理是不是真正的處理方式。
有用度——這個答案有沒有替你做好「決定」那部分的工作?問的不是「這是真的嗎」,而是「我現在可以作出選擇了嗎」。
表達力——讀起來舒不舒服?句子清楚、次序合理、沒有廢話。
用餐廳來比喻,分野就很明顯。準確度是碟裡的東西跟餐牌寫的是否一致;表達力是擺盤;有用度是這一餐到底有沒有讓你吃飽。三者都是真實的優點——而一間廚房完全可以在其中兩項出色,第三項卻很薄弱。
三個系統的成績如下:
| 維度 |
Ed |
ChatGPT |
Gemini |
| 有用度 |
4.24 |
3.62 |
3.47 |
| 準確度 |
3.99 |
3.72 |
3.65 |
| 表達力 |
4.03 |
3.68 |
3.78 |
準確度貼身,表達力更貼身。有用度,才是拉開距離的地方。
一個把問題徹底解決的測試
平均值會掩蓋很多東西,所以報告做了更嚴格的版本:分數完全不動,只改變你在乎什麼。你可以把它想成用不同的科目比重去重新計算同一份試卷——同一批答案,不同的優先次序,然後你就會知道這個學生真正強在哪裡。一個只有在某一種權重下才成立的結果,本身就是那個權重的產物。
| 你重視什麼 |
Ed 的絕對勝出率 |
| 原本的權重(準確 0.45/有用 0.35/表達 0.20) |
58.5% |
| 三項均等 |
56.6% |
| 偏重準確度(0.60/0.30/0.10) |
55.7% |
| 完全剔除有用度(0.70/0/0.30) |
46.2% |
| 只看準確度 |
36.8% |
| 只看表達力 |
23.6% |
| 三選一的隨機基準 |
33.3% |
下半部分值得慢慢讀。把有用度從評分中抽走,優勢就跌至五成以下。只計算「答得對」,數字落在 36.8%——而三個系統之中盲猜,本來就有 33.3%。單論事實本身,這三個系統幾乎難以區分。
(以上只計算絕對勝出,因此第一行低於 62.3% 的標題數字——這裡的打和是剔除,而非攤分。)
這就是核心發現,而它對大眾談論 AI 的方式相當不客氣。把幾個系統分開的,不是知識,而是它們拿這些大家都差不多具備的知識,做了什麼。
逐題紀錄說的是同一件事。在 106 條問題中,Ed 的有用度紀錄是對 ChatGPT 76 勝/15 和/15 負,對 Gemini 75/16/15——對兩者的顯著性皆為 p<0.001。準確度是 58/21/27 和 55/19/32:優勢真實,但幅度較窄。表達力則是 51/31/24 和 41/39/26——留意最後一組的 39 次打和。那是一個各系統大致打成平手的維度。
「這不就是排版靚一點嗎?」
這個質疑問得對,而報告在 4.2 節用一個比任何辯論都乾淨的測試回應了它。
排版對真假無動於衷。表格裡的數字錯了,表格一樣整齊。所以,假如「有用度」量度的其實是標題和項目符號,那麼在事實崩壞的那些題目上,它理應照樣站得住。
結果不然。在 Ed 經核實準確度只得 3.0 或以下的 14 條問題中,它的有用度紀錄塌至 1 勝、3 和、10 負(對手為該題得分較高的一方)。而在全部 106 條問題、同一計算基礎下,紀錄是 64 勝、22 和、20 負。
排版依然在,有用度卻消失了。評分者獎勵的並不是答案的外形,而是裡面那套推理站不站得住。
報告在這一點上很謹慎,我們也應該一樣:對 Ed 而言,有用度與準確度的相關系數為 0.747,所以刻意挑出準確度最低的題目,本身就會在算術上壓低有用度。這次塌陷比單靠相關性所預期的更陡峭,但它並不是一個純粹的實驗。
相關結構提供了第二項佐證——有用度跟準確度的連動有多緊,相對於它跟表達力的連動有多緊:
- Ed:與準確度 0.747,與表達力 0.350
- ChatGPT:0.806/0.640
- Gemini:0.860/0.827
Gemini 那兩項幾乎融為一體(0.827)——它的答案讀起來順,就會被評為有用。Ed 的兩個維度則明顯分開。若「有用度」不過是包裝的化名,它應該與表達力緊緊同步。事實並非如此。
評分者實際寫了什麼
報告中最耐人尋味的一節是 4.3——評分者的文字理由被編碼成主題。兩欄數字:選擇 Ed 時給出的理由(n=129),以及沒有選 Ed 時給出的理由(n=79)。
| 評分者說那個答案做到了什麼 |
選擇 Ed |
沒有選 Ed |
| 解釋推理過程,而不只給出結論 |
26% |
32% |
| 結構清晰易讀——表格、標題 |
26% |
29% |
| 先講結論,再補上支撐細節 |
21% |
30% |
| 數據足夠,而不只是「有數據」 |
17% |
22% |
| 比較幾個選項,而非直接指定一個 |
15% |
15% |
真正的發現不在任何一欄之中,而在兩欄有多接近。
無論評分者選了 Ed 還是否決了它,浮現的都是同一組五項標準。他們沒有選 Ed 的時候,用的是同一把尺——只是判斷另一個答案在這把尺上做得更好。沒有人為了合理化自己的偏好而換一套標準。
這正是這份清單比一個產品結果更有價值的原因。它描述的不是某一個系統,而是這批讀者對「任何理財答案」的要求。同時留意什麼是缺席的:十個數字裡面,沒有一個是關於文筆。
這份數據不能證明什麼
三項限制,因為一個經不起質疑的結果,價值有限。
表達力是打和。 Ed 4.03,Gemini 3.78——這道差距的 p 值是 0.086,未達統計顯著。文筆質素在這幾個系統之間,應視為已經收斂。
準確度的領先是「逐個對手」的領先。 分開來看,Ed 的準確度勝過 ChatGPT,也勝過 Gemini。但若改為逐題對比「該題得分較高的那一方」,優勢便收窄至大致打平,平均差距為 −0.13。Ed 比其中任何一個系統準確;但它並不比兩者各自最好的一次加起來更準確。
假設本身很窄。 這次測試的,是一個為單一領域而建的系統,在該領域之內能否勝過通用助手。僅此而已。它沒有回答哪個 AI 整體更好,也沒有回答消費者理財以外的任何問題。
你可以直接拿來用的部分
把系統名字全部拿走,剩下的是一個可以隨身帶走的測試。下次任何 AI 給你一個關於金錢的答案,按次序問三件事:
- 它對嗎? 必要,但——正如「只看準確度」那一行所示——遠遠不足夠。
- 它讀起來舒服嗎? 令人愉快,但單靠它幾乎沒有價值。只計表達力的勝出率是 23.6%,明顯低於隨機水平。
- 我能據此作出決定嗎? 它有沒有指出你這個處境真正相關的數字、說明它們如何互相作用、並講清楚代表什麼?如果沒有,你手上的是一篇正確的文章,不是一個答案。
第三條是幾乎沒有人問、卻真正做事的一條。它同時能揪出那種語氣自信、卻悄悄漏掉了你的決定所繫的那個數字的答案。
同一套測試也適用於你自己的思考。知道自己的儲蓄率,是一個事實;知道這個比率代表你走在正軌與否,是一個決定——而財務健康(financial fitness)要填補的,正是這道空隙。
第三篇會把這一切變成一份大約一分鐘就跑得完的清單:如何判斷一個 AI 的理財答案。
結語
回答這些問題的幾個系統,所知道的東西其實相差無幾。把它們分開的,是那個答案究竟是為「閱讀」而砌,還是為「決定」而砌。正確是地板,不是目標——而一旦你看見這道分別,往後每一個答案你都會不自覺地用它來衡量。完整的方法、圖表與限制說明,都在 MoneyBench 研究報告。
了解你自己的財務健康狀況
Ed 的財務健康測評,就是把同一套想法用在你身上:不是裁決,而是一張地圖。幾分鐘、無需術語,給你一個可以行動的答案,而不是一個好看的答案。
立即開始:edwealth.ai/check-up,或下載 App:App Store · Google Play
Money at peace. Wealth in motion.
Ed Wealth 是財務研究與自我評估工具,並非持牌投資顧問。本文內容不構成任何財務、投資或稅務建議。所有決定由你自行作出。
資料來源
- Ed Wealth Research, MoneyBench: a fact-verified benchmark of AI assistants on consumer finance questions — edwealth.ai/moneybench
- MoneyBench §4.1,各維度平均分、逐題勝/和/負紀錄及顯著性檢定
- MoneyBench §4.2,權重敏感度分析與低準確度子集測試
- MoneyBench §4.3,評分者文字理由編碼結果(n=129/n=79)