AI 給的理財答案來得很快、讀起來很順,卻幾乎不留任何線索讓你判斷它對不對。問題正正在這裡:一個過時的供款上限和一個最新的供款上限,在螢幕上長得一模一樣——同樣的語氣、同樣的排版、同樣的自信。
你查不了那個模型,但你查得了那個答案。六項檢查已經能處理大部分情況。
叫它給一個你自己能核實的最新數字。看它有沒有把規則和意見分開。看它有沒有把推理過程說出來,而不只是拋一個結論。留意結論是不是放在最前面。問它給了你選項,還是只給了一道指令。最後,看看做這個工具的人,會不會在自己輸的時候也把結果公開。
這六項檢查來自 MoneyBench(完整報告為英文版)——Ed Wealth Research 用真實理財問題,對 Ed、ChatGPT 和 Gemini 做的一次評測。但這些檢查跟 Ed 無關,它們適用於你手上已經打開的任何一個。跑一次,十分鐘之內你會知道的東西,比任何排行榜一年告訴你的都多。
人們已經在照著這些答案做決定
各項調查對使用規模的說法差距很大——美國 TD 的 2026 AI Insights 調查指,有 55% 的美國成年人用 AI 尋求理財指引;Wells Fargo 的 2026 Money Study 則報稱 19%。但兩者方向一致,而且同樣發現 Z 世代使用率最高:TD 的數字是 77%,Wells Fargo 是 38%。
兩個數字之間的落差,是問卷措辭的故事。真正沒有含糊空間的,是接下來發生什麼。美國 Intuit Credit Karma 於 2025 年 8 月 7 至 14 日訪問 1,019 名美國成年人,結果顯示:在曾經照著生成式 AI 理財建議行動的人當中,有 52% 表示因此做了一個差劣的決定或出了錯。
大約一半。這不是叫你換工具的理由,而是叫你用另一種方式去讀這些答案——因為表達得有多自信,跟內容有多準確,完全是兩回事。
以下是六項檢查,後文逐項展開。
| # |
檢查項目 |
該問什麼 |
好答案會怎樣 |
| 1 |
用今天的數字,還是憑記憶? |
「最新數字是多少?截至哪一天?」 |
說出日期,並附上你打得開的來源 |
| 2 |
事實與判斷分開了嗎? |
「哪部分是規則,哪部分是你的看法?」 |
不用你問就已經劃好界線 |
| 3 |
有沒有把推理說出來? |
「為什麼是這個,不是另一個?」 |
講清楚邏輯,而不只是結論 |
| 4 |
結論放在最前嗎? |
不用問——看第一句就知道 |
先給答案,再給支持理由 |
| 5 |
給選項,還是給指令? |
「我實際上有哪兩三個選擇?」 |
比較路徑,講明取捨代價 |
| 6 |
開發者會公開自己輸的時候嗎? |
去看它自己發布的評測 |
方法寫清楚、用外部評審、輸的回合照樣刊出 |
檢查 1:它用的是今天的數字,還是它的記憶?
由這裡開始,因為它最省力,而且抓得到殺傷力最大的失誤。
叫它給一個你一分鐘內能自己核實的最新數字——供款上限、申報死線、某個利率、某隻股票的價格。然後真的去核實。一個依靠訓練資料而非即時來源的模型,會用它講今天數字的同一種語氣,把上一季的數字交到你手上。
MoneyBench 七月那一輪,用自己的成績說明了這一點。在事實未經即時來源核查前,Ed 的分數是 67.6%;按 2026 年 7 月 23 日的來源核查之後,變成 62.3%——跌了 5.3 個百分點,而兩個對照組的分數都上升了。名次沒有改變,但重點是:核查會令分數出現有意義的變動,而在對話框裡問一條問題的人,預設是不會做這道核查的。
好答案會給出數字、註明截至日期,並指向來源。較弱的答案只給你數字——那等於直接叫你相信它。
檢查 2:它有沒有把事實和判斷分開?
供款上限、稅階、死線,這些是規則。你今年應不應該供到上限,這是判斷。兩者是不同性質的說法,出錯的方式也不同——規則錯了可以查證,判斷錯了通常查不了。
把兩者混在一起的答案,更難核實,也更容易被過度信任,因為可查證那一半的權威感,會悄悄轉移到其實只是意見的那一半。直接問:這裡哪部分是規則,哪部分是你的看法?然後,規則去查證,看法去質疑。
好答案不用你問就已經劃好那條線。較弱的答案用同一種平板而自信的語氣,把兩者一併說完。
檢查 3:它有沒有把推理說出來?
這一項不是我們自己想出來的偏好,而是評分者實際說出口的話。
在 MoneyBench 的盲測評分中,人們偏好某個答案時,被引用最多的理由,是它講出了邏輯而不只是拋出結論——在選擇 Ed 的評分者所寫的 129 條理由中,佔 26%。有趣的是另一邊:在某題上選擇了「不是 Ed」的評分者,寫下的 79 條理由裡,同一個標準佔 32%。
換句話說,「把推理說出來」並不是某一個產品的特性,而是人們用來衡量所有工具的共同標準——這也正好令它成為一項真正通用的測試。
問它:為什麼是這個,而不是那個明顯的替代方案?一個能為自己的推理辯護的答案,至少給了你可以反駁的東西;一個只懂重複結論的答案,則什麼都沒留給你。
好答案把路徑攤開。較弱的答案只給你終點。
檢查 4:它有沒有把結論放在最前面?
排序聽起來像是門面功夫,但當你要做決定時,它不是。答案放在最後,你就得先讀三段背景,卻不知道那些背景是為了支持什麼——而你更有可能中途停下,然後照著半截內容行動。
「結論先行」在選擇 Ed 的理由中佔 21%,在反對 Ed 的理由中佔 30%。「結構清楚」——標題、精簡的表格、一眼找得到的答案——則分別是 26% 和 29%。跟檢查 3 是同一個模式:這是讀者普遍想要的東西,而不是某個工具剛好做到的事。
這一項不用問任何問題,看第一句就行:那是答案,還是開場白?
好答案把結論放在上面,理由放在下面。較弱的答案把重點埋起來。
檢查 5:它給你選項,還是只給一道指令?
這一項裡,評測最有用的發現,同時是最令人不安的一個。
「有比較選項」在正反兩邊的理由中都佔 15%——一個平手的比例,本身就暗示底下有事情發生。MoneyBench 第二輪用了兩組不同背景的評分者,細節解釋了這件事。在科技背景的高收入人士當中,Ed 有 62% 的機會被選中;在獨立執業的高收入專業人士當中,這個比例跌至 47%——而他們說自己想要的,是分層次的選項和自我檢查步驟,而不是一個斬釘截鐵的建議。
同一個果斷的答案,在某些人眼中是乾脆俐落,在另一些人眼中卻是越俎代庖。你屬於哪一種,值得在評價任何工具之前先弄清楚,因為那決定了「好答案」對你而言到底長什麼樣。
叫它給你兩三個實際可行的選擇,以及彼此之間的取捨。如果它只能吐出一道指令,那是關於這個工具的事實;如果選項令你不耐煩,那是關於你自己的事實。
好答案會說明有哪幾條路、各自的代價是什麼。較弱的答案丟給你一個結論,並期望你不會追問還有什麼被略過了。
檢查 6:做這個工具的人,會公開自己輸的時候嗎?
任何一家公司都可以發布一份自己贏了的評測。那不是證據,那是加了圖表的宣傳。真正能說明問題的,是方法。
四件事值得看。方法有沒有寫到別人可以重跑一次的程度?評審是不是來自所有受測產品以外?事實有沒有對照即時來源核查過,還是照單全收?以及,輸掉的回合有沒有出現在報告裡,而且篇幅跟贏的回合相當?
既然我們也請你用同一把尺量度我們,那就交代清楚:七月那一輪用了 106 條問題,評審是 Claude(Anthropic),來自三個受測模型家族以外;事實對照 2026 年 7 月 23 日的即時來源核查;核查令 Ed 掉了 5.3 個百分點,兩個對照組則上升。而較早期、成績遠不好看的幾輪,跟七月那一輪刊在同一份報告裡。
一家永遠只給你看自己贏了什麼的公司,其實已經告訴了你它在挑選什麼。
誠實的部分:真正接近的題目,其實分不出高下
有一項發現,值得比頭條數字得到更多注意。在七月那一輪,有 47% 的問題屬於接近題——首兩名的加權分數相差在 0.3 分之內。近乎一半的問題上,這幾個系統的表現幾乎無法分辨。而如果只計準確度,撇除實用性和表達,Ed 的勝出率是 36.8%,對比三選一的隨機基準 33.3%。
差距出現在實用性這一項:三者的平均分分別是 Ed 4.24、ChatGPT 3.62、Gemini 3.47。「有用」是一項真實的分別,但它不等於「正確」;而任何評測結果,都不足以讓你略過對眼前那個答案的核實。
這正是要有一份清單的理由。排行榜描述的是一百條問題的平均表現;而你要問的,是今天、關於你自己的錢的那一條。清單會跟著你走,排行榜不會。
結語
在你已經在用的那個 AI 上,把六項檢查跑一次。大約十分鐘,之後你讀每一個答案的方式都會改變——你不再評價它寫得多流暢,而是評價它有多可查證。
最後還有一件事值得說明。評測衡量的是答案的品質,卻完全說不出你問的是不是對的問題,也說不出你餵給模型的數字是否準確。如果你不知道自己每月的實際支出、手上還有多少緩衝,或者自己的財務健康狀況,那麼即使答案完美,也只是一個對著錯誤輸入的完美答案。這是另一個問題,而沒有一個 AI 能替你解決。
本文是系列文章第三篇。第一篇是我們實測了 AI 的理財答案,第二篇是怎樣的 AI 理財答案才算有用。
如果缺口在「輸入」那一端,Ed 的免費 Financial Reality Check 可以在幾分鐘內幫你整理出自己的數字——任何 AI 答案都建基於這些數字之上。立即開始:edwealth.ai/check-up
Money at peace. Wealth in motion.
Ed Wealth 是財務研究與自我評估工具,並非持牌投資顧問。本文內容不構成任何財務、投資或稅務建議。所有決定由你自行作出。
資料來源
- Ed Wealth Research, MoneyBench: measuring usefulness and factual accuracy on real money questions(2026 年 7 月 Verified Evaluation)— edwealth.ai/moneybench
- TD, 2026 AI Insights Survey(美國)
- Wells Fargo, 2026 Money Study(美國)
- Intuit Credit Karma 調查,訪問 1,019 名美國成年人,2025 年 8 月 7–14 日進行