2026年7月,我們把 106 條真實理財問題交給三個 AI 系統——Ed、ChatGPT 和 Gemini——所有答案以匿名方式評分,評審模型不屬於三者任何一方的模型家族,而每一項關鍵事實都對照即時來源核查過。Ed 在 62.3% 的問題上勝出,Gemini 20.8%,ChatGPT 17.0%。
完整研究已經公開,名為 MoneyBench(報告為英文版),內容包括方法論、評分準則、研究限制,以及我們輸掉的那一輪。
有兩件事值得在讀下去之前先知道。第一,這些問題不是為測試而寫的,而是從真實用戶問過個人理財 AI 的紀錄中抽出來——是那種瑣碎、具體、帶著個人處境的問題,不是教科書式的題目。第二,事實核查那一關令 Ed 的分數下跌。核查之前,Ed 是 67.6%;當每個答案的每項關鍵事實都對照即時來源查證之後,Ed 是 62.3%——被削去 5.3 個百分點,而兩個對手的分數則同時上升。Ed 仍然排第一。
這篇文章講 MoneyBench 量度什麼、測試怎樣搭建。另外兩篇會走得更深:什麼才算一個「有用」的 AI 理財答案,以及你自己可以怎樣判斷一個 AI 理財答案。
為什麼需要這樣一個基準測試
寫程式和數學都有公開的基準測試。你可以查到模型排名、看到題庫、對評分方式提出質疑。個人理財問答卻沒有對應的東西——這其實有點奇怪,因為它正是「答錯代價最大」的領域之一。
理財答案是會被拿去行動的。有人看到一個供款上限,就真的把錢調走;有人看到一個過時的股價,就真的調整了持倉。理財答案還會過期:三月正確的數字,七月可能已經錯了,而 AI 的行文語氣完全不會告訴你眼前這個屬於哪一種。無論對錯,答案都以同樣自信的語氣、同樣即時地出現。
這個落差在行為上看得見。Intuit Credit Karma 一項訪問 1,019 名美國成年人的調查發現,在曾經按 AI 理財建議行動的人當中,52% 表示那導致了一個不好的決定。
所以我們把自己想被拿來量度的那把尺造出來:真實問題、盲測評分、第三方評審、每項事實核查。然後把它連同做法一併公開,讓任何人都能重跑這套流程——包括拿來測我們自己。
我們實際量度什麼
大部分 AI 評測量度的是答案對不對。「對」是必要條件,但它不是這件事的本質。
人們問 AI 理財問題,不是為了核對一個自己已經知道的數字,而是為了做一個決定:應該先還貸款還是先增加退休金供款、花紅應該留現金還是投入市場、某條稅務規則放在自己的處境上到底是什麼意思。一個答案可以完全正確,卻讓你留在原地。
所以 MoneyBench 用 1 至 5 分量度三個維度,並加權計算:準確度 0.45、有用度 0.35、表達 0.20。準確度看事實站不站得住;有用度看這個答案有沒有把人推近一個決定;表達看它讀不讀得順。
權重之上還有一條硬規則:準確度否決權。只要答案裡有一項事實被核查證實是錯的,那個答案就不能在該題勝出——無論它多有用、寫得多好。有用度永遠買不到一個錯數字的通行證。
三輪測試的結果
| 輪次 |
日期 |
Ed |
Gemini |
ChatGPT |
評分方式 |
| Panel I |
2026年5月 |
17.4% |
46.1% |
36.5% |
37 位盲測評分員,1,308 份評分回應 |
| Panel II |
2026年6月 |
54.4% |
28.3% |
17.3% |
25 位盲測評分員,90 條問題,375 票 |
| Verified Evaluation |
2026年7月 |
62.3% |
20.8% |
17.0% |
第三方模型評審、逐題事實核查,106 條問題 |
第一行值得再看一次。五月那一輪,Ed 包尾——三者之中排第三,而且差距不小。
輸因分析的結果很具體,也不是我們原本預期的方向:能力是有的,只是沒有送到用戶面前。在那些被導向 Ed 深度推理路徑的問題上,Ed 排第一——39.8%,對 Gemini 的 30.5% 和 ChatGPT 的 29.7%。但那條路徑只承載約一成流量。大部分問題根本走不到那裡。
之後重建的是檢索、任務調度和答案組裝——問題怎樣被理解、抓取哪些數據、走哪條路徑、答案怎樣拼出來。不是換模型。引擎沒問題,有問題的是管道。
自那之後,Ed 每一輪都排第一。
七月那道差距出在哪裡
| 維度(1–5 分平均) |
Ed |
ChatGPT |
Gemini |
| 有用度 |
4.24 |
3.62 |
3.47 |
| 準確度 |
3.99 |
3.72 |
3.65 |
| 表達 |
4.03 |
3.68 |
3.78 |
表達幾乎是三方打和——三個系統都寫得好。準確度拉開了距離,但幅度不大。真正的差距在有用度,而且很闊:在 106 條問題中,Ed 的有用度有 76 題高於 ChatGPT、75 題高於 Gemini。
這個型態本身就是結論。通用助手並不是不懂理財,它們擅長回答理財問題,卻不太擅長解決理財問題——數字來了,決定沒來。
為什麼這個結果不容易被輕輕帶過
任何公司都可以公開一場自己贏了的測試。真正令結果有份量的,是它在什麼條件下贏。
評審在三個系統之外。 評分由 Anthropic 的 Claude 執行——它不屬於 ChatGPT 的模型家族、不屬於 Gemini 的,也不屬於 Ed 本身所採用、未公開的基礎模型。沒有人在批改自己的功課,我們也一樣。
呈現方式是匿名而且隨機排序的。 答案被移除所有能辨認來源的痕跡,並以隨機位置呈現,令排列次序影響不到分數。
每一項關鍵事實都對照即時來源核查。 不是抽樣——是每個答案的每一項關鍵事實,全部對照 2026年7月23日的即時來源查證。106 條問題全部核查成功。
對手沒有被削弱。 ChatGPT 以 GPT-5.6 Sol 的 Pro effort 運行——高於它自己的預設值;Gemini 以 3.6 Flash 預設值運行;Ed 則是一般生產環境設定,跟用戶用到的完全一樣。
還有兩件事——如果換成我們要來挑這份報告的毛病,會第一時間指出的兩件事。
核查那一關令我們付出代價。Ed 由 67.6% 跌至 62.3%,同時 Gemini 由 17.1% 升至 20.8%、ChatGPT 由 15.2% 升至 17.0%。一場為自己臉上貼金而設計的測試,不會加入一個把自己 5.3 分削走、再送給對手的步驟。這場勝出,捱過了最傷自己的那一關。
而五月那一輪在報告裡。Ed 以 17.4% 排第三,那一輪的公開程度跟我們贏的幾輪一樣——分數、輸因分析、診斷結論,全部在內。一個只在贏的時候才公開的基準測試,不是基準測試,是新聞稿。
補一個統計角度:Ed 七月得分的 95% 置信區間為 [52.8%, 71.7%],而三方隨機的基準線是 33.3%。即使取區間最低那一端,仍然明顯高於隨機水平。
這場測試證明不到什麼
三項研究是彼此相關的測試,不是一條乾淨的成長曲線——報告本身寫明,只有 Panel I 與 Verified Evaluation 之間的比較是成立的,我們把這句保留在內,而不是硬把三個點連成一條漂亮的線。七月那一輪,有 47% 的問題屬於接近打和的情況。而受檢驗的假設本身很窄:一個為單一領域而建的系統,在那個領域之內,表現勝過通用助手。不是「Ed 比前沿模型更會推理」。它不是,而我們也從來沒有這樣宣稱。
這場測試說的東西,比「Ed 更聰明」更小、但更有用:在理財問題這件事上,為目的而建的系統贏過通用系統——在第三方評審、匿名盲測、事實核查的條件下。
結語
在 106 條經事實核查的真實理財問題中,Ed 勝出 62.3%,Gemini 20.8%,ChatGPT 17.0%,由三個模型家族以外的評審匿名評分。差距來自有用度——答案有沒有把人帶到一個決定——而不是文筆,三者在文筆上相當接近。
我們認為這才是應該量度的東西,也是應該採用的量度方式:公開流程、用外部評審、即使核查會扣自己的分也照樣核查、輸掉的那一輪照樣公開。完整報告(英文)已經公開,測試流程亦然。
了解你自己的財務健康狀況
基準測試量度的是答案。而你自己的錢,是一條關於你的問題——你的現金流、你的備用金、你的目標。Ed 的財務健康測評,幾分鐘內帶你走過財務健康的五個維度,無需術語,告訴你哪裡強、哪裡有風險。這正是通用助手,與一個屬於你自己的 money person 之間的分別。
立即開始:edwealth.ai/check-up,或下載 App:App Store · Google Play
Money at peace. Wealth in motion.
Ed Wealth 是財務研究與自我評估工具,並非持牌投資顧問。本文內容不構成任何財務、投資或稅務建議。所有決定由你自行作出。
資料來源
- Ed Wealth Research, MoneyBench: measuring usefulness and factual accuracy on real money questions(2026年8月)— edwealth.ai/moneybench
- Intuit Credit Karma,訪問 1,019 名美國成年人的調查,調查期 2025年8月7至14日