我們用真實理財問題實測三個 AI。結果是這樣。

EdWealth
· Sep 03 2026
我們用真實理財問題實測三個 AI。結果是這樣。

2026年7月,我們把 106 條真實理財問題交給三個 AI 系統——Ed、ChatGPT 和 Gemini——所有答案以匿名方式評分,評審模型不屬於三者任何一方的模型家族,而每一項關鍵事實都對照即時來源核查過。Ed 在 62.3% 的問題上勝出,Gemini 20.8%,ChatGPT 17.0%。

完整研究已經公開,名為 MoneyBench(報告為英文版),內容包括方法論、評分準則、研究限制,以及我們輸掉的那一輪。

有兩件事值得在讀下去之前先知道。第一,這些問題不是為測試而寫的,而是從真實用戶問過個人理財 AI 的紀錄中抽出來——是那種瑣碎、具體、帶著個人處境的問題,不是教科書式的題目。第二,事實核查那一關令 Ed 的分數下跌。核查之前,Ed 是 67.6%;當每個答案的每項關鍵事實都對照即時來源查證之後,Ed 是 62.3%——被削去 5.3 個百分點,而兩個對手的分數則同時上升。Ed 仍然排第一。

這篇文章講 MoneyBench 量度什麼、測試怎樣搭建。另外兩篇會走得更深:什麼才算一個「有用」的 AI 理財答案,以及你自己可以怎樣判斷一個 AI 理財答案

為什麼需要這樣一個基準測試

寫程式和數學都有公開的基準測試。你可以查到模型排名、看到題庫、對評分方式提出質疑。個人理財問答卻沒有對應的東西——這其實有點奇怪,因為它正是「答錯代價最大」的領域之一。

理財答案是會被拿去行動的。有人看到一個供款上限,就真的把錢調走;有人看到一個過時的股價,就真的調整了持倉。理財答案還會過期:三月正確的數字,七月可能已經錯了,而 AI 的行文語氣完全不會告訴你眼前這個屬於哪一種。無論對錯,答案都以同樣自信的語氣、同樣即時地出現。

這個落差在行為上看得見。Intuit Credit Karma 一項訪問 1,019 名美國成年人的調查發現,在曾經按 AI 理財建議行動的人當中,52% 表示那導致了一個不好的決定。

所以我們把自己想被拿來量度的那把尺造出來:真實問題、盲測評分、第三方評審、每項事實核查。然後把它連同做法一併公開,讓任何人都能重跑這套流程——包括拿來測我們自己。

我們實際量度什麼

大部分 AI 評測量度的是答案對不對。「對」是必要條件,但它不是這件事的本質。

人們問 AI 理財問題,不是為了核對一個自己已經知道的數字,而是為了做一個決定:應該先還貸款還是先增加退休金供款、花紅應該留現金還是投入市場、某條稅務規則放在自己的處境上到底是什麼意思。一個答案可以完全正確,卻讓你留在原地。

所以 MoneyBench 用 1 至 5 分量度三個維度,並加權計算:準確度 0.45、有用度 0.35、表達 0.20。準確度看事實站不站得住;有用度看這個答案有沒有把人推近一個決定;表達看它讀不讀得順。

權重之上還有一條硬規則:準確度否決權。只要答案裡有一項事實被核查證實是錯的,那個答案就不能在該題勝出——無論它多有用、寫得多好。有用度永遠買不到一個錯數字的通行證。

三輪測試的結果

輪次 日期 Ed Gemini ChatGPT 評分方式
Panel I 2026年5月 17.4% 46.1% 36.5% 37 位盲測評分員,1,308 份評分回應
Panel II 2026年6月 54.4% 28.3% 17.3% 25 位盲測評分員,90 條問題,375 票
Verified Evaluation 2026年7月 62.3% 20.8% 17.0% 第三方模型評審、逐題事實核查,106 條問題

第一行值得再看一次。五月那一輪,Ed 包尾——三者之中排第三,而且差距不小。

輸因分析的結果很具體,也不是我們原本預期的方向:能力是有的,只是沒有送到用戶面前。在那些被導向 Ed 深度推理路徑的問題上,Ed 排第一——39.8%,對 Gemini 的 30.5% 和 ChatGPT 的 29.7%。但那條路徑只承載約一成流量。大部分問題根本走不到那裡。

之後重建的是檢索、任務調度和答案組裝——問題怎樣被理解、抓取哪些數據、走哪條路徑、答案怎樣拼出來。不是換模型。引擎沒問題,有問題的是管道。

自那之後,Ed 每一輪都排第一。

七月那道差距出在哪裡

維度(1–5 分平均) Ed ChatGPT Gemini
有用度 4.24 3.62 3.47
準確度 3.99 3.72 3.65
表達 4.03 3.68 3.78

表達幾乎是三方打和——三個系統都寫得好。準確度拉開了距離,但幅度不大。真正的差距在有用度,而且很闊:在 106 條問題中,Ed 的有用度有 76 題高於 ChatGPT、75 題高於 Gemini。

這個型態本身就是結論。通用助手並不是不懂理財,它們擅長回答理財問題,卻不太擅長解決理財問題——數字來了,決定沒來。

為什麼這個結果不容易被輕輕帶過

任何公司都可以公開一場自己贏了的測試。真正令結果有份量的,是它在什麼條件下贏。

評審在三個系統之外。 評分由 Anthropic 的 Claude 執行——它不屬於 ChatGPT 的模型家族、不屬於 Gemini 的,也不屬於 Ed 本身所採用、未公開的基礎模型。沒有人在批改自己的功課,我們也一樣。

呈現方式是匿名而且隨機排序的。 答案被移除所有能辨認來源的痕跡,並以隨機位置呈現,令排列次序影響不到分數。

每一項關鍵事實都對照即時來源核查。 不是抽樣——是每個答案的每一項關鍵事實,全部對照 2026年7月23日的即時來源查證。106 條問題全部核查成功。

對手沒有被削弱。 ChatGPT 以 GPT-5.6 Sol 的 Pro effort 運行——高於它自己的預設值;Gemini 以 3.6 Flash 預設值運行;Ed 則是一般生產環境設定,跟用戶用到的完全一樣。

還有兩件事——如果換成我們要來挑這份報告的毛病,會第一時間指出的兩件事。

核查那一關令我們付出代價。Ed 由 67.6% 跌至 62.3%,同時 Gemini 由 17.1% 升至 20.8%、ChatGPT 由 15.2% 升至 17.0%。一場為自己臉上貼金而設計的測試,不會加入一個把自己 5.3 分削走、再送給對手的步驟。這場勝出,捱過了最傷自己的那一關。

而五月那一輪在報告裡。Ed 以 17.4% 排第三,那一輪的公開程度跟我們贏的幾輪一樣——分數、輸因分析、診斷結論,全部在內。一個只在贏的時候才公開的基準測試,不是基準測試,是新聞稿。

補一個統計角度:Ed 七月得分的 95% 置信區間為 [52.8%, 71.7%],而三方隨機的基準線是 33.3%。即使取區間最低那一端,仍然明顯高於隨機水平。

這場測試證明不到什麼

三項研究是彼此相關的測試,不是一條乾淨的成長曲線——報告本身寫明,只有 Panel I 與 Verified Evaluation 之間的比較是成立的,我們把這句保留在內,而不是硬把三個點連成一條漂亮的線。七月那一輪,有 47% 的問題屬於接近打和的情況。而受檢驗的假設本身很窄:一個為單一領域而建的系統,在那個領域之內,表現勝過通用助手。不是「Ed 比前沿模型更會推理」。它不是,而我們也從來沒有這樣宣稱。

這場測試說的東西,比「Ed 更聰明」更小、但更有用:在理財問題這件事上,為目的而建的系統贏過通用系統——在第三方評審、匿名盲測、事實核查的條件下。

結語

在 106 條經事實核查的真實理財問題中,Ed 勝出 62.3%,Gemini 20.8%,ChatGPT 17.0%,由三個模型家族以外的評審匿名評分。差距來自有用度——答案有沒有把人帶到一個決定——而不是文筆,三者在文筆上相當接近。

我們認為這才是應該量度的東西,也是應該採用的量度方式:公開流程、用外部評審、即使核查會扣自己的分也照樣核查、輸掉的那一輪照樣公開。完整報告(英文)已經公開,測試流程亦然。

了解你自己的財務健康狀況

基準測試量度的是答案。而你自己的錢,是一條關於你的問題——你的現金流、你的備用金、你的目標。Ed 的財務健康測評,幾分鐘內帶你走過財務健康的五個維度,無需術語,告訴你哪裡強、哪裡有風險。這正是通用助手,與一個屬於你自己的 money person 之間的分別。

立即開始:edwealth.ai/check-up,或下載 App:App Store · Google Play

Money at peace. Wealth in motion.

Ed Wealth 是財務研究與自我評估工具,並非持牌投資顧問。本文內容不構成任何財務、投資或稅務建議。所有決定由你自行作出。

資料來源

  • Ed Wealth Research, MoneyBench: measuring usefulness and factual accuracy on real money questions(2026年8月)— edwealth.ai/moneybench
  • Intuit Credit Karma,訪問 1,019 名美國成年人的調查,調查期 2025年8月7至14日
推薦閱讀
現金放多少才算太多?用「幾個月開支」給你一個誠實的答案,再教你算出閒置現金每年悄悄付出的代價。

現金放多少才算太多?

先給答案:當超過三個月的開支,長期停在一個幾乎沒有利息的戶口裡,現金就由審慎變成昂貴。閒置現金在一個月開支以內,屬正常周轉;一至三個月,是值得看一眼的灰色地帶;超過三個月,這筆錢已經不是謹慎,而是在付一個你其實寫得出來的代價。 留意這句話量度的是什麼:不是你持有多少現金,而是你持有多少沒有在賺任何東西的現金。這是兩條不同的問題,把它們混為一談,正是這個話題長期令人困惑的原因。六個月開支放在年息 4% 的戶口,是一筆建構良好的應急備用金;六個月開支放在年息 0.07% 的支票戶口,是同一筆錢在做一份差得多的工作。金額一樣,安全程度一樣,結果差天共地。 所以真正要做的只有兩步:算出你實際閒置了多少個月的開支,再算出這部分每年的代價。兩步加起來約十分鐘,而且不需要你今天調動任何一元,也不需要你決定任何事。 有一件事這篇文章不會做:告訴你該用哪一種戶口。那條問題已經有專屬的答案。這一篇談的是——到底應該放多少在那裡。 大多數人衡量自己的現金,是看一個數字。但單看數字,判斷不了有沒有問題,因為同一筆金額放在不同地方,表現完全不同。
EdWealth
·
Sep 10 2026
A dated, sourced comparison of financial advisor apps in 2026 — Betterment, Ed, Empower, Facet, Fidelity Go, Origin, Range, Schwab, Vanguard, Wealthfront, Zoe. Every price checked 1 September 2026, plus the arithmetic on when a flat fee actually beats a percentage.

The best financial advisor apps in 2026, and what each one actually costs

"Best financial advisor app" is three different questions wearing one coat, which is why most roundups of them are useless. Some want software that moves the money — invests it, rebalances it, harvests the losses. That's a robo-advisor: Betterment, Wealthfront, Fidelity Go, Schwab, Vanguard Digital Advisor. Some want to talk to a human who is licensed and accountable: Facet, Empower, Vanguard Personal Advisor Select, Range, Zoe. And some want guidance without handing over a percentage of their assets every year for as long as they hold them — a smaller lane, where Ed and Origin sit. Those three needs don't share a winner. A list that ranks them together has to pretend they do. So this page separates them, then prices everything. Every fee below was checked on 1 September 2026 against the company's own pricing page or its SEC filing. Where a figure couldn't be confirmed, it says so instead of guessing — and one product's price is missing entirely, for a reason we explain. Transparency:
EdWealth
·
Sep 08 2026
六項檢查,適用於任何一個 AI——ChatGPT、Gemini、Ed,或你手上正在用的那個——判斷它的理財答案值不值得照做。全部來自一項 106 條問題的評測實際發現。

如何判斷 AI 給你的理財答案,值不值得照做

AI 給的理財答案來得很快、讀起來很順,卻幾乎不留任何線索讓你判斷它對不對。問題正正在這裡:一個過時的供款上限和一個最新的供款上限,在螢幕上長得一模一樣——同樣的語氣、同樣的排版、同樣的自信。 你查不了那個模型,但你查得了那個答案。六項檢查已經能處理大部分情況。 叫它給一個你自己能核實的最新數字。看它有沒有把規則和意見分開。看它有沒有把推理過程說出來,而不只是拋一個結論。留意結論是不是放在最前面。問它給了你選項,還是只給了一道指令。最後,看看做這個工具的人,會不會在自己輸的時候也把結果公開。 這六項檢查來自 MoneyBench(完整報告為英文版)——Ed Wealth Research 用真實理財問題,對 Ed、ChatGPT 和 Gemini 做的一次評測。但這些檢查跟 Ed 無關,它們適用於你手上已經打開的任何一個。跑一次,十分鐘之內你會知道的東西,比任何排行榜一年告訴你的都多。 各項調查對使用規模的說法差距很大——美國 TD 的 2026 AI Insights 調查指,有 55% 的美國成年人用 AI 尋求理財指引;Wells Fargo 的 2026 Money Study 則報稱 19%。但兩者方向一致,而且同樣發現 Z 世代使用率最高:TD 的數字是 77%,Wells Fargo 是 38%。
EdWealth
·
Sep 07 2026
三個 AI 系統在準確度上只差三分之一分,但其中一個被選中的次數,仍然接近另外兩個的三倍。MoneyBench 的數據顯示,真正拉開距離的,不是誰答得對。

答案正確,跟答案有用,是兩回事

三個 AI 系統回答了同樣的 106 條個人理財問題。單看事實準確度,它們幾乎並駕齊驅——五分制之下分別是 3.99、3.72 和 3.65,差距約三分之一分。但當評分者要挑出「哪個答案我真正想要」,其中一個被選中的次數,接近另外兩個的三倍。 有趣的正是這道落差。既然三者答得同樣正確,勝出的那個就不是靠「答得對」贏。下一個直覺猜測是它寫得比較好——但表達力恰恰是三者最接近的一項,其中一組對比的差距甚至未達統計顯著。 那麼被獎勵的,究竟是什麼?是第三種特質。MoneyBench 研究報告(全文為英文)對它的定義異常精準:一個有用的答案,是能夠支撐它所回應的那個決定——它指出與問題相關的數字、說明這些數字如何互相作用,並講清楚它們對眼前這個選擇意味著什麼。 聽起來很溫和,實際上卻是全部分野所在——而且一旦你看得見它,就可以用它來檢驗任何一個 AI 給你的理財答案。 這是三篇系列的第二篇。第一篇講述這場測試如何設計、以及發現了什麼。
EdWealth
·
Sep 04 2026
持有五隻 ETF,不等於已經分散風險——熱門增長型 ETF 之間的持倉重疊,最高可達 73%。教你檢查自己的組合,是不是暗地裡只是一注集中的賭注。

你手上的 5 隻 ETF,可能全部在押同一注

先講一個會令你重新審視自己組合的數字:QQQ 的持倉之中,按比重計有 94.8% 的股票,其實已經住在 VOO 裡面。這不是輕微重疊,是幾乎完全重疊。 如果你兩隻都持有,你並沒有把分散程度加倍,你只是把對同一批公司的曝險加倍——而且為此付了兩份基金費用。 再把 VGT 加進去,畫面就更奇怪了。你最大的三個倉位——NVIDIA、Microsoft、Apple——現在同時出現在三隻不同的基金裡。三隻 ETF,三份開支比率,押的卻是同一批公司的同一注。 這就是 ETF 重疊問題。它很安靜,帳面上看起來像分散投資,而且經常令一班本來很謹慎的人措手不及。 要看穿這件事,最簡單的方法就是把三隻最熱門的增長型與大市 ETF 的主要持倉並排放在一起。以下是截至 2026 年年中,它們裡面裝著的東西:
EdWealth
·
Sep 02 2026
覺得自己財務落後?美國數據說,很可能不是。這 7 個財務健康跡象,每一個都對得上一項真實基準——由美國聯儲局的「400 美元測試」,到大部分人的債務其實長甚麼樣。

7 個跡象:你的財務其實比你以為的好

簡短答案:只要你手上有任何現金緩衝、大概講得出自己每個月花多少、有錢在流向退休儲備,而且從未拖欠過租金或按揭——單看這幾項,你已經走在一大批美國成年人前面。「覺得自己落後」和「真的落後」是兩回事,而數據只量度得到其中一樣。 金錢焦慮有件事很弔詭:感受最強烈的,往往正是那些真的有在做功夫的人。你拿自己去比同事的新車、表哥剛裝修好的廚房、陌生人的旅行相——那是一份沒有附上資產負債表的精華片段。沒有人會把信用卡月結單貼上網。 所以這篇文章不會拿你去跟一個「甚麼都搞掂晒」的想像人物比較,而是拿你去跟真實數據比較:美國聯儲局、FINRA、紐約聯儲銀行所能核實的,美國人實際上是怎樣處理金錢的。這不是要令任何人覺得高人一等——而是因為,安慰要建立在證據上,才值錢。 你可以把它當成一次財務健康(financial fitness)檢測裡,比較令人安心的那一半。真正的體檢不只找出毛病,也會告訴你哪幾項數字其實沒問題,讓你不用再為它們擔心。以下七個跡象,說明你的狀況可能比你以為的好。 美國聯儲局十年來一直問同一條問題:如果突然多出一筆 400 美元的開支,你能否用現金、存款、或一張隨即會全數清還的信用卡應付?
EdWealth
·
Sep 01 2026
不敢看戶口結餘,不是懶惰,而是一種有名字的焦慮反應:鴕鳥效應。這篇拆解「不看」正在悄悄花掉你多少錢,以及一個讓你重新敢看的 90 秒習慣。

為甚麼你不敢看銀行戶口?(以及不看的代價)

先講結論:你避開銀行戶口,是因為「看」感覺像宣判,而大腦天生會替你避開宣判。行為經濟學給這個現象起了名字——鴕鳥效應(ostrich effect)——它普遍到研究人員可以在整個市場的數據裡量度出來。但逃避有一個安靜的價錢:只有不知道結餘的人才會中的透支費與逾期費、無聲扣款好幾個月的訂閱、由小拖成大的問題。解法不是一次徹底的財務大檢查,而是每星期 90 秒、只看三個數字——小到不會觸發恐懼,卻足以讓恐懼慢慢縮小。 那個動作你一定認得。銀行 App 一直在主畫面,你每次都滑過去。結餘提示彈出來,你看也不看就撥走。有人問「這個你負擔得起嗎?」你答「應該可以」——因為「應該」不需要打開 App。 如果這正是你,先記住第一件事:你沒有問題。你不懶惰、不是不負責任,也不是特別「唔識理財」。逃避財務資訊是行為金融學裡記錄得最完整的行為之一,從戶口見紅的學生到身家千萬的投資者都會出現。「不想看」是人類的出廠設定,不是性格缺陷。 第二件事就沒那麼舒服了:逃避不是免費的。你不看的時候,戶口並不會暫停。而一個沒人看管的戶口裡,幾乎所有出錯的事,都是愈早發現愈便宜。 這篇文章做三件事:解釋大腦為甚麼這樣做、認真算一算「不看」的代價,然後給你一條回去的路——只需 90 秒,而且不痛。
EdWealth
·
Aug 31 2026
美國調查發現,43% 的 Gen Z 認為自己對財務的感覺與現實脫節——不少人存款五位數(美元)仍覺得自己一貧如洗。這個落差有個名字:money dysmorphia。這篇拆解它從何而來,以及如何把「感覺」和「數學」分開。

Money dysmorphia:為甚麼數字明明不差,你卻總覺得自己很窮

簡短答案:財務「感覺」與財務「現實」之間那道令人焦慮的落差,有一個名字——money dysmorphia(金錢認知失調)。它很普遍(美國約四成 Gen Z 與千禧世代自認有這種狀況),不是性格缺陷,而且不會因為存款增加就自動消失。同一項調查裡,有這種感覺的人當中,超過三分之一存款其實超過一萬美元。解方通常不是再多儲一點,而是重新校準:用能把「感覺」和「數學」分開來量度的方法,看清自己的財務。 你打開戶口,數字⋯⋯其實不差。有存款,帳單準時交,沒有甚麼火燒眼眉。但背景那把聲音沒有停過:我落後了。其他人都走得比我前。只要一個月出事,一切就完了。 如果你的財務焦慮,總是對不上你的財務數據——你不是多心,也絕對不是孤例。這道落差,有名字。而要把它看清楚,需要的是一把財務健康(financial fitness)的尺。 Money dysmorphia(金錢認知失調),指對自己財務狀況的認知出現扭曲——最常見的形態,是覺得自己遠比實際數字差。令這個詞流行起來的 Credit Karma 調查,把它定義為「對自身財務的扭曲認知,並可能因此作出錯誤決定」。 有一點要先講清楚:這不是臨床診斷。沒有任何診斷手冊收錄它,這篇文章也不是心理治療。它只是替一種真實、可量度的模式起了個有用的名字——就像「doomscrolling」形容一種行為,而不是給你扣上病名。
EdWealth
·
Aug 29 2026
美國聯儲局數據:35歲以下家庭資產淨值中位數為3.9萬美元,55至64歲為36.45萬美元。但中位數答不了「我還好嗎」這個問題——真正該看的是這五個維度。

各年齡的財務健康標準:25、35、45、55歲,怎樣才算「還可以」?

先給你搜尋這個題目時想要的數字。根據美國聯儲局最新一輪消費者財務狀況調查(Survey of Consumer Finances,2022年數據,該調查每三年進行一次),美國家庭資產淨值中位數為:35歲以下3.9萬美元、35至44歲13.56萬美元、45至54歲24.72萬美元、55至64歲36.45萬美元。 接下來是比較不中聽的部分:按年齡劃分的資產淨值基準,大概是理財世界裡最多人搜尋、卻最沒有用的一組數字。 不是因為數據不準——聯儲局的調查已經是這類數據的最高標準。問題在於,中位數只告訴你「全國的中間點在哪裡」,卻答不了你真正想問的問題:我還好嗎?單一的資產淨值數字,看不出你的趨勢是向上還是向下、一個突發狀況會不會把你擊倒、你的財務是靠系統運轉還是靠焦慮硬撐。這些才是財務健康(Financial Fitness)要衡量的東西——而在不同年齡,起關鍵作用的維度並不相同。 所以這篇文章做兩件事。先誠實地給你基準數據,因為那是你搜尋的原因;然後給你更有用的讀法:在25、35、45、55歲,五個財務健康維度——安全、掌控、進度、增長潛力、心理負擔——之中,哪一兩個才是真正的重點。(如果你對這五個維度還不熟悉,完整的解釋在什麼是財務健康。) 資料來源:美國聯儲局消費者財務狀況調查(2022年)。作為參考,美國全體家庭的整體中位數為19.29萬美元。以上均為美國數據,反映的是美國家庭的狀況,並非香港基準。
EdWealth
·
Aug 28 2026
一份可以一次過完成的 12 項財務健康檢查清單,涵蓋安全、掌控、進度、增值與心理負擔五大範疇。每項都是一條是非題,答「否」就有明確的下一步。

財務健康檢查清單:12 項檢查,一小時誠實面對

檢視自己的財務健康,不一定需要財務顧問。你需要的,是一個誠實的小時。 這是一份財務健康(Financial Fitness)檢查清單——12 條是非題,分為五個範疇:安全、掌控、進度、增值、心理負擔。沒有計分,沒有公式,也不用開試算表。只有問題和誠實的答案,而每答一個「否」,都附有一個具體的下一步。 規則很簡單:每季找一次時間坐下來——每三個月一次是合適的頻率——手邊只需要電話和銀行 App,日程上不安排其他事。逐條誠實作答,「算是吧」一律當「否」。你的目標不是及格,而是趁問題還容易處理時,找出缺口在哪裡。 如果你對「財務健康」這個概念還陌生——它是一種需要持續維護的狀態,而不是一個達標數字——完整的解釋在什麼是財務健康。如果你想要的是一個實際分數而不是一張清單,可以改做財務健康測試。這篇文章,是寫給今天就想動手做點什麼的人。 先把整份清單放在最前面。後文會逐項解釋,以及答「否」時該怎麼辦。
EdWealth
·
Aug 27 2026

金錢安穩,財富前行。

你的錢,終於有人打理;你的生活,終於不再匆忙。