我們用真實理財問題實測三個 AI。結果是這樣。

EdWealth
· Sep 03 2026
我們用真實理財問題實測三個 AI。結果是這樣。

2026年7月,我們把 106 條真實理財問題交給三個 AI 系統——Ed、ChatGPT 和 Gemini——所有答案以匿名方式評分,評審模型不屬於三者任何一方的模型家族,而每一項關鍵事實都對照即時來源核查過。Ed 在 62.3% 的問題上勝出,Gemini 20.8%,ChatGPT 17.0%。

完整研究已經公開,名為 MoneyBench(報告為英文版),內容包括方法論、評分準則、研究限制,以及我們輸掉的那一輪。

有兩件事值得在讀下去之前先知道。第一,這些問題不是為測試而寫的,而是從真實用戶問過個人理財 AI 的紀錄中抽出來——是那種瑣碎、具體、帶著個人處境的問題,不是教科書式的題目。第二,事實核查那一關令 Ed 的分數下跌。核查之前,Ed 是 67.6%;當每個答案的每項關鍵事實都對照即時來源查證之後,Ed 是 62.3%——被削去 5.3 個百分點,而兩個對手的分數則同時上升。Ed 仍然排第一。

這篇文章講 MoneyBench 量度什麼、測試怎樣搭建。另外兩篇會走得更深:什麼才算一個「有用」的 AI 理財答案,以及你自己可以怎樣判斷一個 AI 理財答案

為什麼需要這樣一個基準測試

寫程式和數學都有公開的基準測試。你可以查到模型排名、看到題庫、對評分方式提出質疑。個人理財問答卻沒有對應的東西——這其實有點奇怪,因為它正是「答錯代價最大」的領域之一。

理財答案是會被拿去行動的。有人看到一個供款上限,就真的把錢調走;有人看到一個過時的股價,就真的調整了持倉。理財答案還會過期:三月正確的數字,七月可能已經錯了,而 AI 的行文語氣完全不會告訴你眼前這個屬於哪一種。無論對錯,答案都以同樣自信的語氣、同樣即時地出現。

這個落差在行為上看得見。Intuit Credit Karma 一項訪問 1,019 名美國成年人的調查發現,在曾經按 AI 理財建議行動的人當中,52% 表示那導致了一個不好的決定。

所以我們把自己想被拿來量度的那把尺造出來:真實問題、盲測評分、第三方評審、每項事實核查。然後把它連同做法一併公開,讓任何人都能重跑這套流程——包括拿來測我們自己。

我們實際量度什麼

大部分 AI 評測量度的是答案對不對。「對」是必要條件,但它不是這件事的本質。

人們問 AI 理財問題,不是為了核對一個自己已經知道的數字,而是為了做一個決定:應該先還貸款還是先增加退休金供款、花紅應該留現金還是投入市場、某條稅務規則放在自己的處境上到底是什麼意思。一個答案可以完全正確,卻讓你留在原地。

所以 MoneyBench 用 1 至 5 分量度三個維度,並加權計算:準確度 0.45、有用度 0.35、表達 0.20。準確度看事實站不站得住;有用度看這個答案有沒有把人推近一個決定;表達看它讀不讀得順。

權重之上還有一條硬規則:準確度否決權。只要答案裡有一項事實被核查證實是錯的,那個答案就不能在該題勝出——無論它多有用、寫得多好。有用度永遠買不到一個錯數字的通行證。

三輪測試的結果

輪次 日期 Ed Gemini ChatGPT 評分方式
Panel I 2026年5月 17.4% 46.1% 36.5% 37 位盲測評分員,1,308 份評分回應
Panel II 2026年6月 54.4% 28.3% 17.3% 25 位盲測評分員,90 條問題,375 票
Verified Evaluation 2026年7月 62.3% 20.8% 17.0% 第三方模型評審、逐題事實核查,106 條問題

第一行值得再看一次。五月那一輪,Ed 包尾——三者之中排第三,而且差距不小。

輸因分析的結果很具體,也不是我們原本預期的方向:能力是有的,只是沒有送到用戶面前。在那些被導向 Ed 深度推理路徑的問題上,Ed 排第一——39.8%,對 Gemini 的 30.5% 和 ChatGPT 的 29.7%。但那條路徑只承載約一成流量。大部分問題根本走不到那裡。

之後重建的是檢索、任務調度和答案組裝——問題怎樣被理解、抓取哪些數據、走哪條路徑、答案怎樣拼出來。不是換模型。引擎沒問題,有問題的是管道。

自那之後,Ed 每一輪都排第一。

七月那道差距出在哪裡

維度(1–5 分平均) Ed ChatGPT Gemini
有用度 4.24 3.62 3.47
準確度 3.99 3.72 3.65
表達 4.03 3.68 3.78

表達幾乎是三方打和——三個系統都寫得好。準確度拉開了距離,但幅度不大。真正的差距在有用度,而且很闊:在 106 條問題中,Ed 的有用度有 76 題高於 ChatGPT、75 題高於 Gemini。

這個型態本身就是結論。通用助手並不是不懂理財,它們擅長回答理財問題,卻不太擅長解決理財問題——數字來了,決定沒來。

為什麼這個結果不容易被輕輕帶過

任何公司都可以公開一場自己贏了的測試。真正令結果有份量的,是它在什麼條件下贏。

評審在三個系統之外。 評分由 Anthropic 的 Claude 執行——它不屬於 ChatGPT 的模型家族、不屬於 Gemini 的,也不屬於 Ed 本身所採用、未公開的基礎模型。沒有人在批改自己的功課,我們也一樣。

呈現方式是匿名而且隨機排序的。 答案被移除所有能辨認來源的痕跡,並以隨機位置呈現,令排列次序影響不到分數。

每一項關鍵事實都對照即時來源核查。 不是抽樣——是每個答案的每一項關鍵事實,全部對照 2026年7月23日的即時來源查證。106 條問題全部核查成功。

對手沒有被削弱。 ChatGPT 以 GPT-5.6 Sol 的 Pro effort 運行——高於它自己的預設值;Gemini 以 3.6 Flash 預設值運行;Ed 則是一般生產環境設定,跟用戶用到的完全一樣。

還有兩件事——如果換成我們要來挑這份報告的毛病,會第一時間指出的兩件事。

核查那一關令我們付出代價。Ed 由 67.6% 跌至 62.3%,同時 Gemini 由 17.1% 升至 20.8%、ChatGPT 由 15.2% 升至 17.0%。一場為自己臉上貼金而設計的測試,不會加入一個把自己 5.3 分削走、再送給對手的步驟。這場勝出,捱過了最傷自己的那一關。

而五月那一輪在報告裡。Ed 以 17.4% 排第三,那一輪的公開程度跟我們贏的幾輪一樣——分數、輸因分析、診斷結論,全部在內。一個只在贏的時候才公開的基準測試,不是基準測試,是新聞稿。

補一個統計角度:Ed 七月得分的 95% 置信區間為 [52.8%, 71.7%],而三方隨機的基準線是 33.3%。即使取區間最低那一端,仍然明顯高於隨機水平。

這場測試證明不到什麼

三項研究是彼此相關的測試,不是一條乾淨的成長曲線——報告本身寫明,只有 Panel I 與 Verified Evaluation 之間的比較是成立的,我們把這句保留在內,而不是硬把三個點連成一條漂亮的線。七月那一輪,有 47% 的問題屬於接近打和的情況。而受檢驗的假設本身很窄:一個為單一領域而建的系統,在那個領域之內,表現勝過通用助手。不是「Ed 比前沿模型更會推理」。它不是,而我們也從來沒有這樣宣稱。

這場測試說的東西,比「Ed 更聰明」更小、但更有用:在理財問題這件事上,為目的而建的系統贏過通用系統——在第三方評審、匿名盲測、事實核查的條件下。

結語

在 106 條經事實核查的真實理財問題中,Ed 勝出 62.3%,Gemini 20.8%,ChatGPT 17.0%,由三個模型家族以外的評審匿名評分。差距來自有用度——答案有沒有把人帶到一個決定——而不是文筆,三者在文筆上相當接近。

我們認為這才是應該量度的東西,也是應該採用的量度方式:公開流程、用外部評審、即使核查會扣自己的分也照樣核查、輸掉的那一輪照樣公開。完整報告(英文)已經公開,測試流程亦然。

了解你自己的財務健康狀況

基準測試量度的是答案。而你自己的錢,是一條關於你的問題——你的現金流、你的備用金、你的目標。Ed 的財務健康測評,幾分鐘內帶你走過財務健康的五個維度,無需術語,告訴你哪裡強、哪裡有風險。這正是通用助手,與一個屬於你自己的 money person 之間的分別。

立即開始:edwealth.ai/check-up,或下載 App:App Store · Google Play

Money at peace. Wealth in motion.

Ed Wealth 是財務研究與自我評估工具,並非持牌投資顧問。本文內容不構成任何財務、投資或稅務建議。所有決定由你自行作出。

資料來源

  • Ed Wealth Research, MoneyBench: measuring usefulness and factual accuracy on real money questions(2026年8月)— edwealth.ai/moneybench
  • Intuit Credit Karma,訪問 1,019 名美國成年人的調查,調查期 2025年8月7至14日
推薦閱讀
六項檢查,適用於任何一個 AI——ChatGPT、Gemini、Ed,或你手上正在用的那個——判斷它的理財答案值不值得照做。全部來自一項 106 條問題的評測實際發現。

如何判斷 AI 給你的理財答案,值不值得照做

AI 給的理財答案來得很快、讀起來很順,卻幾乎不留任何線索讓你判斷它對不對。問題正正在這裡:一個過時的供款上限和一個最新的供款上限,在螢幕上長得一模一樣——同樣的語氣、同樣的排版、同樣的自信。 你查不了那個模型,但你查得了那個答案。六項檢查已經能處理大部分情況。 叫它給一個你自己能核實的最新數字。看它有沒有把規則和意見分開。看它有沒有把推理過程說出來,而不只是拋一個結論。留意結論是不是放在最前面。問它給了你選項,還是只給了一道指令。最後,看看做這個工具的人,會不會在自己輸的時候也把結果公開。 這六項檢查來自 MoneyBench(完整報告為英文版)——Ed Wealth Research 用真實理財問題,對 Ed、ChatGPT 和 Gemini 做的一次評測。但這些檢查跟 Ed 無關,它們適用於你手上已經打開的任何一個。跑一次,十分鐘之內你會知道的東西,比任何排行榜一年告訴你的都多。 各項調查對使用規模的說法差距很大——美國 TD 的 2026 AI Insights 調查指,有 55% 的美國成年人用 AI 尋求理財指引;Wells Fargo 的 2026 Money Study 則報稱 19%。但兩者方向一致,而且同樣發現 Z 世代使用率最高:TD 的數字是 77%,Wells Fargo 是 38%。
EdWealth
·
Sep 07 2026
三個 AI 系統在準確度上只差三分之一分,但其中一個被選中的次數,仍然接近另外兩個的三倍。MoneyBench 的數據顯示,真正拉開距離的,不是誰答得對。

答案正確,跟答案有用,是兩回事

三個 AI 系統回答了同樣的 106 條個人理財問題。單看事實準確度,它們幾乎並駕齊驅——五分制之下分別是 3.99、3.72 和 3.65,差距約三分之一分。但當評分者要挑出「哪個答案我真正想要」,其中一個被選中的次數,接近另外兩個的三倍。 有趣的正是這道落差。既然三者答得同樣正確,勝出的那個就不是靠「答得對」贏。下一個直覺猜測是它寫得比較好——但表達力恰恰是三者最接近的一項,其中一組對比的差距甚至未達統計顯著。 那麼被獎勵的,究竟是什麼?是第三種特質。MoneyBench 研究報告(全文為英文)對它的定義異常精準:一個有用的答案,是能夠支撐它所回應的那個決定——它指出與問題相關的數字、說明這些數字如何互相作用,並講清楚它們對眼前這個選擇意味著什麼。 聽起來很溫和,實際上卻是全部分野所在——而且一旦你看得見它,就可以用它來檢驗任何一個 AI 給你的理財答案。 這是三篇系列的第二篇。第一篇講述這場測試如何設計、以及發現了什麼。
EdWealth
·
Sep 04 2026
持有五隻 ETF,不等於已經分散風險——熱門增長型 ETF 之間的持倉重疊,最高可達 73%。教你檢查自己的組合,是不是暗地裡只是一注集中的賭注。

你手上的 5 隻 ETF,可能全部在押同一注

先講一個會令你重新審視自己組合的數字:QQQ 的持倉之中,按比重計有 94.8% 的股票,其實已經住在 VOO 裡面。這不是輕微重疊,是幾乎完全重疊。 如果你兩隻都持有,你並沒有把分散程度加倍,你只是把對同一批公司的曝險加倍——而且為此付了兩份基金費用。 再把 VGT 加進去,畫面就更奇怪了。你最大的三個倉位——NVIDIA、Microsoft、Apple——現在同時出現在三隻不同的基金裡。三隻 ETF,三份開支比率,押的卻是同一批公司的同一注。 這就是 ETF 重疊問題。它很安靜,帳面上看起來像分散投資,而且經常令一班本來很謹慎的人措手不及。 要看穿這件事,最簡單的方法就是把三隻最熱門的增長型與大市 ETF 的主要持倉並排放在一起。以下是截至 2026 年年中,它們裡面裝著的東西:
EdWealth
·
Sep 02 2026
覺得自己財務落後?美國數據說,很可能不是。這 7 個財務健康跡象,每一個都對得上一項真實基準——由美國聯儲局的「400 美元測試」,到大部分人的債務其實長甚麼樣。

7 個跡象:你的財務其實比你以為的好

簡短答案:只要你手上有任何現金緩衝、大概講得出自己每個月花多少、有錢在流向退休儲備,而且從未拖欠過租金或按揭——單看這幾項,你已經走在一大批美國成年人前面。「覺得自己落後」和「真的落後」是兩回事,而數據只量度得到其中一樣。 金錢焦慮有件事很弔詭:感受最強烈的,往往正是那些真的有在做功夫的人。你拿自己去比同事的新車、表哥剛裝修好的廚房、陌生人的旅行相——那是一份沒有附上資產負債表的精華片段。沒有人會把信用卡月結單貼上網。 所以這篇文章不會拿你去跟一個「甚麼都搞掂晒」的想像人物比較,而是拿你去跟真實數據比較:美國聯儲局、FINRA、紐約聯儲銀行所能核實的,美國人實際上是怎樣處理金錢的。這不是要令任何人覺得高人一等——而是因為,安慰要建立在證據上,才值錢。 你可以把它當成一次財務健康(financial fitness)檢測裡,比較令人安心的那一半。真正的體檢不只找出毛病,也會告訴你哪幾項數字其實沒問題,讓你不用再為它們擔心。以下七個跡象,說明你的狀況可能比你以為的好。 美國聯儲局十年來一直問同一條問題:如果突然多出一筆 400 美元的開支,你能否用現金、存款、或一張隨即會全數清還的信用卡應付?
EdWealth
·
Sep 01 2026
不敢看戶口結餘,不是懶惰,而是一種有名字的焦慮反應:鴕鳥效應。這篇拆解「不看」正在悄悄花掉你多少錢,以及一個讓你重新敢看的 90 秒習慣。

為甚麼你不敢看銀行戶口?(以及不看的代價)

先講結論:你避開銀行戶口,是因為「看」感覺像宣判,而大腦天生會替你避開宣判。行為經濟學給這個現象起了名字——鴕鳥效應(ostrich effect)——它普遍到研究人員可以在整個市場的數據裡量度出來。但逃避有一個安靜的價錢:只有不知道結餘的人才會中的透支費與逾期費、無聲扣款好幾個月的訂閱、由小拖成大的問題。解法不是一次徹底的財務大檢查,而是每星期 90 秒、只看三個數字——小到不會觸發恐懼,卻足以讓恐懼慢慢縮小。 那個動作你一定認得。銀行 App 一直在主畫面,你每次都滑過去。結餘提示彈出來,你看也不看就撥走。有人問「這個你負擔得起嗎?」你答「應該可以」——因為「應該」不需要打開 App。 如果這正是你,先記住第一件事:你沒有問題。你不懶惰、不是不負責任,也不是特別「唔識理財」。逃避財務資訊是行為金融學裡記錄得最完整的行為之一,從戶口見紅的學生到身家千萬的投資者都會出現。「不想看」是人類的出廠設定,不是性格缺陷。 第二件事就沒那麼舒服了:逃避不是免費的。你不看的時候,戶口並不會暫停。而一個沒人看管的戶口裡,幾乎所有出錯的事,都是愈早發現愈便宜。 這篇文章做三件事:解釋大腦為甚麼這樣做、認真算一算「不看」的代價,然後給你一條回去的路——只需 90 秒,而且不痛。
EdWealth
·
Aug 31 2026
美國調查發現,43% 的 Gen Z 認為自己對財務的感覺與現實脫節——不少人存款五位數(美元)仍覺得自己一貧如洗。這個落差有個名字:money dysmorphia。這篇拆解它從何而來,以及如何把「感覺」和「數學」分開。

Money dysmorphia:為甚麼數字明明不差,你卻總覺得自己很窮

簡短答案:財務「感覺」與財務「現實」之間那道令人焦慮的落差,有一個名字——money dysmorphia(金錢認知失調)。它很普遍(美國約四成 Gen Z 與千禧世代自認有這種狀況),不是性格缺陷,而且不會因為存款增加就自動消失。同一項調查裡,有這種感覺的人當中,超過三分之一存款其實超過一萬美元。解方通常不是再多儲一點,而是重新校準:用能把「感覺」和「數學」分開來量度的方法,看清自己的財務。 你打開戶口,數字⋯⋯其實不差。有存款,帳單準時交,沒有甚麼火燒眼眉。但背景那把聲音沒有停過:我落後了。其他人都走得比我前。只要一個月出事,一切就完了。 如果你的財務焦慮,總是對不上你的財務數據——你不是多心,也絕對不是孤例。這道落差,有名字。而要把它看清楚,需要的是一把財務健康(financial fitness)的尺。 Money dysmorphia(金錢認知失調),指對自己財務狀況的認知出現扭曲——最常見的形態,是覺得自己遠比實際數字差。令這個詞流行起來的 Credit Karma 調查,把它定義為「對自身財務的扭曲認知,並可能因此作出錯誤決定」。 有一點要先講清楚:這不是臨床診斷。沒有任何診斷手冊收錄它,這篇文章也不是心理治療。它只是替一種真實、可量度的模式起了個有用的名字——就像「doomscrolling」形容一種行為,而不是給你扣上病名。
EdWealth
·
Aug 29 2026
美國聯儲局數據:35歲以下家庭資產淨值中位數為3.9萬美元,55至64歲為36.45萬美元。但中位數答不了「我還好嗎」這個問題——真正該看的是這五個維度。

各年齡的財務健康標準:25、35、45、55歲,怎樣才算「還可以」?

先給你搜尋這個題目時想要的數字。根據美國聯儲局最新一輪消費者財務狀況調查(Survey of Consumer Finances,2022年數據,該調查每三年進行一次),美國家庭資產淨值中位數為:35歲以下3.9萬美元、35至44歲13.56萬美元、45至54歲24.72萬美元、55至64歲36.45萬美元。 接下來是比較不中聽的部分:按年齡劃分的資產淨值基準,大概是理財世界裡最多人搜尋、卻最沒有用的一組數字。 不是因為數據不準——聯儲局的調查已經是這類數據的最高標準。問題在於,中位數只告訴你「全國的中間點在哪裡」,卻答不了你真正想問的問題:我還好嗎?單一的資產淨值數字,看不出你的趨勢是向上還是向下、一個突發狀況會不會把你擊倒、你的財務是靠系統運轉還是靠焦慮硬撐。這些才是財務健康(Financial Fitness)要衡量的東西——而在不同年齡,起關鍵作用的維度並不相同。 所以這篇文章做兩件事。先誠實地給你基準數據,因為那是你搜尋的原因;然後給你更有用的讀法:在25、35、45、55歲,五個財務健康維度——安全、掌控、進度、增長潛力、心理負擔——之中,哪一兩個才是真正的重點。(如果你對這五個維度還不熟悉,完整的解釋在什麼是財務健康。) 資料來源:美國聯儲局消費者財務狀況調查(2022年)。作為參考,美國全體家庭的整體中位數為19.29萬美元。以上均為美國數據,反映的是美國家庭的狀況,並非香港基準。
EdWealth
·
Aug 28 2026
一份可以一次過完成的 12 項財務健康檢查清單,涵蓋安全、掌控、進度、增值與心理負擔五大範疇。每項都是一條是非題,答「否」就有明確的下一步。

財務健康檢查清單:12 項檢查,一小時誠實面對

檢視自己的財務健康,不一定需要財務顧問。你需要的,是一個誠實的小時。 這是一份財務健康(Financial Fitness)檢查清單——12 條是非題,分為五個範疇:安全、掌控、進度、增值、心理負擔。沒有計分,沒有公式,也不用開試算表。只有問題和誠實的答案,而每答一個「否」,都附有一個具體的下一步。 規則很簡單:每季找一次時間坐下來——每三個月一次是合適的頻率——手邊只需要電話和銀行 App,日程上不安排其他事。逐條誠實作答,「算是吧」一律當「否」。你的目標不是及格,而是趁問題還容易處理時,找出缺口在哪裡。 如果你對「財務健康」這個概念還陌生——它是一種需要持續維護的狀態,而不是一個達標數字——完整的解釋在什麼是財務健康。如果你想要的是一個實際分數而不是一張清單,可以改做財務健康測試。這篇文章,是寫給今天就想動手做點什麼的人。 先把整份清單放在最前面。後文會逐項解釋,以及答「否」時該怎麼辦。
EdWealth
·
Aug 27 2026
一份五分鐘可完成的免費財務健康自測:10條問題,涵蓋安全、掌控、進度、增值、心理負擔五個維度,找出最需要你優先處理的一環。

財務健康自測:10條問題,誠實為自己打分

你搜尋「財務健康測試」,那就不繞圈子:測試就在下面。10條問題,五分鐘,滿分20分。不用留電郵,也沒有「結果已為你準備好」的關卡。 開始前只說一件事。這類測評最有名的版本,是美國消費者金融保護局(CFPB)的財務幸福感量表(Financial Well-Being Scale)——一份由美國政府機構設計的10條問題問卷,用來衡量人們的真實財務狀況。CFPB在全美國進行調查時,美國成年人的平均得分是54分(滿分100),而大約三分之一的人得分在50分或以下——在這個區間,連基本開支都難以應付的機率明顯偏高。所以,如果下面的測試讓你有點刺痛,你並不孤單。 這份自測涵蓋五個維度——安全、掌控、進度、增值、心理負擔——每個維度兩條問題。(如果你想了解為什麼財務健康(financial fitness)要用多個維度而不是一個數字來衡量,完整的論述在這裡。這篇文章只做一件事:測試。) 誠實作答。沒有人在看,一個好看但失真的分數幫不到任何人。 每條問題給自己0、1或2分,累計總分。
EdWealth
·
Aug 26 2026
財務健康不等於有錢,也不等於信貸評分高。它看的是你的財務能否承受衝擊、持續累積,以及不佔據你的腦袋。這五個跡象,你可以逐一對照。

什麼是財務健康?五個跡象,代表你其實做得不錯

財務健康(financial fitness),是指你的財務能同時做到三件事:撐得起日常生活、承受衝擊而不崩潰、其餘時間不佔據你的腦袋。它衡量的是韌性和方向——不是你擁有多少錢。 最後這一點,正是大多數人搞錯的地方。我們慣常用來評估財務的訊號,量度的其實是別的東西。戶口結餘告訴你今天有多少錢。薪金告訴你每月流入多少。信貸評分告訴你銀行怎樣看你。但沒有一個能告訴你:遇上糟糕的一個月,你的財務撐不撐得住?今年賺的錢,有沒有真正累積成什麼? 「財務健康」這個比喻不只是一個好聽的名字。體重是一個數字;體能是一種能力——你能不能跑上樓梯、感冒後恢復得快不快、提著大袋日用品走多遠。兩個體重相同的人,身體狀態可以差天共地。金錢也一樣:兩個收入相同、甚至資產淨值相同的人,財務狀態可以完全不同。一個遇到汽車突然壞掉,處理完就繼續生活;另一個因為同一件事,煩足一個月。 所以真正的問題不是「我有多少錢」,而是「我的財務承受得起什麼」。以下是它在現實中的樣子。 先說清楚財務健康不是什麼,因為最常見的兩個替代指標,都不成立。
EdWealth
·
Aug 25 2026

金錢安穩,財富前行。

你的錢,終於有人打理;你的生活,終於不再匆忙。