Google 於 2026 年 8 月 13 日發布了 Gemini 3.7 Flash,距離 Gemini 3.6 Flash 只有三週時間。重點在於這是一款更強大且更經濟的模型,專為程式編寫、知識工作和多步驟代理(multi-step agents)而建。對投資人來說,有趣的問題並不是 Gemini 是否能寫出更好的程式碼,而是文件理解、工具使用、規劃與成本的改進,是否能讓股票研究在真實世界規模下更有用。
簡短的答案是肯定的——但有一個重要的限定條件。
Gemini 3.7 Flash 可接受文字、影像、音訊、影片與 PDF 輸入,支援最多一百萬個 token 的上下文視窗,最多可產生 64,000 個輸出 token,並能使用函數、以搜尋為依據(search grounding)、檔案搜尋、程式碼執行及其他工具。這些能力自然對應到研究任務,例如閱讀年報、比較財報電話會議、擷取關鍵績效指標,及在新證據出現時監控投資論點。
但一個更有能力的模型並不等同於一個可靠的投資流程。它仍可能產生幻覺、遺漏腳註、混淆報導數字與調整後數字,或從不完整的證據構造出有說服力的敘述。Google 自身的模型卡明確將幻覺列為模型已知的侷限之一。因此,實用的結論應更精確:Gemini 3.7 Flash 提升了 AI 協助金融研究的上限,但同時使研究設計、來源控管、驗證以及人類判斷變得更為重要。
Google 實際發布了什麼
Gemini 3.7 Flash 是 Google Gemini 3 Flash 系列的下一代版本。Google 將其描述為用於程式編寫與代理的最智慧的「主力」模型。它已透過 Gemini API 與 Google AI Studio 一般開放使用,並出現在數款 Google 應用程式與企業產品中。
該模型針對的是品質必須與速度和營運成本共存的市場定位。這一定位很重要。投資研究很少單靠一個精彩的 prompt 就能完成。完整的工作流程可能需要打開數十份文件、擷取即時資訊、抽取數百個數據點、執行計算、比較時期、檢查引用,並在新申報出現時重複這個流程。當這些步驟乘以多家公司與多個研究循環時,成本、延遲與工具可靠性上的小差異就會變得具有實質影響。
Google 的官方文件列出了以下核心規格:
| 能力 | Gemini 3.7 Flash 規格 | 對投資研究的相關性 |
|---|---|---|
| 輸入類型 | 文字、影像、影片、音訊與 PDF | 可處理申報文件、簡報、圖表、會議音訊等格式 |
| 上下文視窗 | 最多 1,048,576 個輸入標記 (tokens) | 可在單一流程中分析大量文件集,但取決於檢索與注意力品質 |
| 最大輸出 | 65,536 個標記 | 支援詳細報告、結構化抽取與長篇比較 |
| 思考控制 | 低、中與高 | 讓開發者在成本與延遲與更深入推理間權衡 |
| 工具支援 | 函數呼叫、檔案搜尋、程式碼執行、搜尋基礎、結構化輸出、URL 上下文等 | 使證據檢索、計算、資料管線與可稽核的輸出格式成為可能 |
| 可用性 | 一般可用 | 適合用於生產實驗,但須受應用層級控管 |
| 介紹性 API 價格 | 直到 2026 年底,每百萬輸入標記 $0.75、每百萬輸出標記 $3.75 | 降低高量文件與代理流程的成本 |
介紹價格需要背景說明。它於 2026 年 12 月 31 日到期;Google 將 2027 年 1 月 1 日起的定價列為每百萬輸入標記 $1.50 與每百萬輸出標記 $7.50。生產研究平台還需支付檢索、資料庫、市場數據、編排、監控、儲存與品質控制的費用——不僅僅是模型標記費。
模型說明卡也指出 Gemini 3.7 Flash 是以 Gemini 3.6 Flash 為基礎,並在推理基礎上加入演算法改進。這是一個漸進式的版本發布,而非宣稱已解決所有財務分析問題。Google 強調在軟體工程、知識工作、網頁開發、遵循指示、規劃與工具呼叫方面的提升。
最後一項最與投資人相關。財務研究是一項知識工作與代理執行的問題:找到正確的證據、使用適當的工具、保留推理鏈條,並知道何時現有資訊不足。
對投資人最重要的改進
在複雜知識工作上的更佳表現
Google 強調一個名為 GDP.pdf 的專家級 PDF 理解基準。Google 報導 Gemini 3.7 Flash 的得分為 34.0%,而 Gemini 3.6 Flash 為 22.0%。在另一個名為 GDPval-AA v2 的知識工作評估中,Google 報導 3.7 Flash 的 Elo 分數為 1,525,而 3.6 Flash 為 1,422。發佈資料也顯示在部分程式碼與代理基準上有改善。並非所有公開結果都往上移動:例如在 CharXiv 推理上,3.7 Flash 在有無工具情況下的分數都略低於 3.6 Flash。這種混合結果提醒我們應在重要的任務上評估模型,而非把一次發布的整體平均視為普遍證明。
該百分比不該被解讀為「在股票研究上 34% 的準確率」。GDP.pdf 並不是投資基準、報酬預測或更佳證券選擇的證據。它是 Google 在特定條件下,針對某項專家文件理解評估所報告的結果。
儘管如此,方向性仍然重要。股票研究結合了許多相同的基礎作業:閱讀複雜資料、遵循多步指示、綜合證據、產出結構化的工作成果,以及在證據改變時修正結論。能更穩定執行這些操作的模型,可以減少分析師在形成實際投資判斷前所需的人工修補量。
更有紀律的多步驟執行
Google 表示 Gemini 3.7 Flash 更能適應阻礙、在必要時釐清意圖、更忠實地遵循指示,並在多步驟規劃與工具呼叫上投入更多努力。
這比一個華麗的答案更有影響力。試想一個評估軟體公司成長是否改善的請求。實用的代理人可能需要:
- 取得最新的 10-Q、財報發布、投資人簡報與電話會議逐字稿。
- 識別披露的營收、固定匯率成長、未履行業績義務、淨保留率、客戶數與指引。
- 標準化已改動的指標定義。
- 計算環比與年比比較。
- 區分管理層評論與已報告事實。
- 將新證據與投資者的原始論點相比較。
- 為每項重要結論附上引用來源。
- 將未解決的一致性衝突標記出來,供人工審查。
在第二步失敗的系統仍可能在第六步產生流暢的報告。這就是為何工具紀律很重要。更好的規劃與更少的工具錯誤,可以在語言品質變得相關之前改善流程的完整性。
多模態輸入正成為實用的研究資源
財務資訊並非僅以純文字儲存。季報簡報可能以堆疊圖表顯示事業部構成。銀行簡報可能包含以影像嵌入的表格。會議影片可能包含逐字稿未描述的產品示範。年報可能在版面中結合文字、表格、圖解與註腳,若草率轉為文字便會喪失意義。
Gemini 3.7 Flash 可接受文字、影像、影片、音訊與 PDF。Google 也展示了模型如何將複雜的年報轉化為互動式資料故事。該示範並不能證明財務上的正確性,但它說明了現階段研究應用可涵蓋的格式種類。
多模態可以降低擷取過程中遺失的資訊。理論上,AI 系統可以在評估圖表時同時考量其標題與註腳,而不是接收到支離破碎的 OCR 片段。它可以將執行長的事先講稿與產品示範中的視覺證據相互比對。當逐字稿不完整時,它也能檢視財報電話會議的音訊檔。
這裡的「可以」很重要。多模態輸入並不保證正確解讀。圖表可能使用被截短的座標軸;投影片可能省略定義;影片既帶來資訊也會帶來雜訊。每一項抽取出的主張仍需有權威來源,且對於重要數據,應與申報文件或公司揭露再次核對。
現代的金融研究涵蓋文字、表格、圖表、音訊、影片與 PDF 等多種格式——不僅僅是一份財報新聞稿。
一百萬 token 的視窗改變了工作區的規模
一百萬 token 的上下文視窗足以容納大量的申報文件、逐字稿、簡報與筆記。這帶來了短上下文系統難以實現的可能性。分析師可以比較數年的年報、閱讀完整的季度電話會議逐字稿,或在不需要把每個問題拆成孤立提示的情況下,同時檢視公司與一小組競爭者。
長上下文不等同於完美記憶。模型在非常大的提示中可能對資訊的注意力分配不均。重複文件可能造成矛盾。舊數據與新數據可能被混淆。檢索(retrieval)仍可能勝過無差別地塞入大量資料,因為檢索能挑出最相關的段落,並讓證據集維持在可管理的範圍內。
因此,大上下文視窗最好的使用方式並不是「上傳所有東西然後完全信任答案」。而是在研究系統已經知道它要找什麼時,保留更多相關的周邊證據。例如,在分析毛利率變動時,系統可以同時包含當前的註腳、先前的指引、過往的事業部組合變化與管理層的說明,而不是只依賴擷取出來的一句話。
較低成本讓持續分析更可行
Flash 模型的實際承諾一直在於規模化。以 Google 的入門價格,一個工作流程可以在比許多高階前沿模型選項更低的模型成本下處理大量輸入。這使得過去昂貴的習慣變得更現實:在每次申報後重新檢查觀察名單、進行獨立的看多與看空分析、對擷取的指標做二次驗證,或監控新證據是否與投資論點相互矛盾。
如果把節省下來的費用用在驗證上,較低的成本可以提升品質;但如果只是用來產生更多報告,也可能增加噪音。相關的商業問題不是單一答案的成本,而是一次經過驗證、可用於決策的研究更新的成本。
Gemini 3.7 Flash 在何處能改善股票研究工作流程
閱讀申報文件而不失去問題焦點
年報內容全面,但並不會自動解釋其含義。模型能在數秒內摘要一份 10-K,但通用的摘要可能不會告訴投資人真正重要的事。更有用的任務是以問題為導向:收益模式發生了哪些變化?哪些費用是真正具彈性的?營運資本的改善是因為營運本身還是時點因素?以股票為基礎的薪酬如何影響攤薄?公司在非 GAAP 呈現中內含了哪些假設?
Gemini 的長文脈與 PDF 支援可以幫助將原始研究問題與文件保持連結。一個設計良好的工作流程可能會將會計政策、區隔業績、風險因素變動與腳註抽取到一致的結構中。然後由程式碼執行來計算比率,而不是要求語言模型以對話方式執行算術。結構化輸出可以強制每個指標都帶有期間、單位、定義與來源位置。AlphaVue 的 公司一頁式概覽(針對申報文件與已報告事實) 說明了在更深入分析前為何那樣的證據層級很重要。
這種分工至關重要。模型負責識別與解讀證據。確定性程式碼進行計算。研究應用程式會檢查數字與引用是否一致。
比較跨期獲利,而不只是總結單季表現
市場對變化作出反應,而非孤立的數據點。公司即使超越共識,若該超越來自短期利得、指引品質惡化或成長轉向低利潤率業務,仍可能削弱其長期論點。相反地,一個標題式的失利可能掩蓋留存率改善或刻意的投資週期。
一個 AI 代理可以將最新一季與管理層早期預期及投資者論點進行比較。它可以識別語言、指引範圍、區隔重點、資本配置與風險揭露的變化。有了足夠的上下文,它能追溯管理層首次引入某一指標的時間以及該指標定義是否改變。
輸出不應該是二元的「好」或「壞」分數。它應該是一個變化紀錄:
- 在公布前預期為何?
- 實際報告了什麼?
- 哪些證據支持原先論點?
- 哪些證據與之矛盾?
- 哪些仍然模糊不清?
- 哪項未來觀察可以解決這些模糊?
這個結構把財報摘要變成研究更新。
建立更嚴謹的競品比較
將這種研究方法應用於您的股票
輸入股票代碼並取得您可以繼續探索的研究摘要。
同業比較常失敗,因為輸入並不可比。一家公司報告年度經常性收入(ARR),另一家報告剩餘履約義務,第三家則兩者皆不披露。毛利率定義各有不同。財務年度不對齊。區隔邊界會改變。
Gemini 3.7 Flash 的工具使用與大範圍上下文可以支持一個正規化工作流程:擷取每家公司的揭露內容、將指標映射到共用分類法、標記定義差異,並僅在證據允許的情況下計算可比趨勢。然後由人類分析師決定剩餘差異是否在經濟上具意義。
有價值的結果有時候可能是「這些數據不應被比較」。當 AI 被允許拒絕虛假的精確性時,研究會變得更值得信賴。
將新聞視為證據而非情緒
檢索依據與網址上下文使整合最新資訊更容易,但新聞工作流程的品質取決於來源層級。公司申報文件通常應高於轉載的摘要。監管機關的命令應該高於有關該命令的評論。有署名且當場發言的聲明不同於匿名的市場謠傳。
代理人可以根據來源、日期、主題以及與論點的關係,對新資訊進行分類。供應商的公告可能支持需求論點,但削弱利潤率論點。監管變動可能只影響某一地區。競爭者的產品發表或許對定價具有實質影響,但與短期營收無關。
目標不是對每則頭條標注看多或看空,而是把一項新事實與它所改變的假設連結起來。
製作揭示假設的情境分析
情境分析在能使不確定性可見時是有用的;當模型捏造出精確預測並以自信的文字掩蓋背後的假設時,則是危險的。
Gemini 可以協助生成情境結構、識別變數並說明因果關係。程式碼執行可以套用明確的公式。一個健全的輸出會將假設與計算分開,並將計算與解釋分離。
| 研究層級 | AI 的適當角色 | 必要控管 |
|---|---|---|
| 證據擷取 | 尋找相關的申報文件、逐字稿與官方揭露 | 來源排序、時間戳記及完整引用紀錄 |
| 資料擷取 | 將表格與文字轉換為結構化欄位 | 模式驗證、單位、期間檢查與抽查審核 |
| 計算 | 提出公式並透過工具執行情境模型 | 確定性程式碼與可重現的輸入 |
| 詮釋 | 說明驅動因素、矛盾點與權衡 | 看多/看空檢視與明確的不確定性 |
| 決策 | 釐清哪些證據會強化或推翻論點 | 投資者判斷;不可自動化確定性 |
最高價值的工作流程將檢索、擷取、計算、詮釋與最終投資決策分開。
Gemini 3.7 Flash 無法解決的問題
幻覺(hallucinations)仍是首要風險
Google 的模型說明明確指出 Gemini 3.7 Flash 可能會出現基礎模型的限制,例如幻覺。在金融領域,即使是小的幻覺也可能造成極大影響。捏造的指引數字會改變估值。不存在的主管引述會讓論點看似被證實。錯誤的單位可能把數百萬變成數十億。
問題不一定是明顯的捏造。模型可能把兩個真實事實合併成一個錯誤陳述、附上錯誤的引用,或在未提示有更新揭露的情況下使用舊數字。流暢的語言使這些錯誤更難發現,因為輸出看起來相當完整。
因此,每項具重大影響的財務主張都應保留指向基礎證據的連結。數值欄位應包含單位與期間。系統應區分直接事實、計算、管理層主張、分析師推論與未解決的問題。
大型上下文視窗並不保證完全注意力
一百萬個標記擴大了容量,但也會擴大搜尋空間。餵給模型十年的文件可能會引入過時的定義、重複的發布、修訂的申報文件,以及互相矛盾的指引。如果應用程式不依照日期和權威性對證據進行排序,模型可能會從錯誤的版本產生看似連貫的答案。
良好的研究系統仍然需要檢索、文件識別、去重、版本控制與時間邏輯。最新的申報不應悄悄覆蓋歷史紀錄,歷史證據也不應冒充為當前的指引。
基準測試不衡量投資回報
Google 已公布的評估涵蓋程式撰寫、推理、代理人、跨模態能力、多語言表現與長上下文處理。這些結果有助於開發者了解模型的相對行為,但並不證明市場時機掌握、超額報酬、預測校準或識別錯誤定價證券的能力。
這個區別很重要,因為投資具有對抗性且依賴歷程。公開資訊已被許多市場參與者處理過。更好的摘要可能會提升分析師的速度,但不會創造優勢。即使商業預測正確,若估值已將其折現,仍可能導致不佳的投資結果。
任何負責任的文章都不應將基準上的優勢解讀為 Gemini 能「打敗市場」的主張。相關的檢驗標準應是該應用是否能幫助投資人建立更完整、一致且可查核的決策。
即時資訊仍需工具與時間戳記
模型說明書標示 Gemini 3.7 Flash 的知識截止於 2026 年 3 月,同時指出某些領域的資訊可能僅截至 2025 年 1 月。模型可以透過搜尋接地(search grounding)等工具存取較新的資訊,但單靠內部模型不應被視為即時的市場資料庫。
對於股票研究,所有與時間相關的回答都應註明其資訊日期。價格、估值、指引、持股情況,甚至公司的報告結構都可能改變。沒有時間戳記卻標示為「當前」的研究報告已難以查核。
提示工程無法取代存取權或資料品質
模型無法分析其在法律或技術上無法存取的資料。高級市場資料來源、完整逐字稿、共識預估和替代數據集可能有授權限制。免費的網路來源可能有延遲、不完整,或在沒有脈絡下被再發布。
研究應用必須尊重資料權利並揭露其來源範圍。再精巧的提示也無法彌補缺失的證據。
模型不擁有投資決策權
AI 系統可以整理事實並質疑假設。但除非那些限制被明確表徵,否則它並不瞭解投資人的完整流動性需求、稅務狀況、持倉集中度、投資期限或對回撤的容忍度。即便如此,適合性與受託責任的考量也超出模型生成敘述的範疇。
人類投資人仍對決策負責。這不是形式上的免責聲明,而是一項設計要求:工作流程應揭露不確定性與替代方案,而非製造虛假的信心。
使用 Gemini 進行股票分析的實務方式
最安全的起點是一項範圍狹窄且具有可見證據軌跡的任務。不要從「我應該買這檔股票嗎?」這類問題開始。應從可以由既定來源回答的問題著手。
舉例:
使用公司最新的財報發布、10-Q 與財報電話會議逐字稿,比較報告的營收成長、毛利率、營業利率、自由現金流與指引,並與前一季做比較。對每一項數字,回傳期間、單位、來源文件與確切來源位置。將已報告的事實與你的解讀分開。列出文件之間的任何衝突,並在沒有證據前不要試圖解決。
這個提示有用,因為它指定了來源、欄位、證據來源以及在不確定情況下的行為。生產系統應該更進一步,強制輸出結構、以程式驗證計算,並自動檢查連結。
一個有紀律的工作流程可以遵循六個階段。
1. 在蒐集證據前先定義論點
以可被否證(可反駁)的方式書寫主張。「這是一間很棒的公司」無法被檢驗。「當企業客戶事業部擴大時,營收成長能維持高於20%且營業利潤率擴張」則包含可觀察的變數。
定義哪些情況會強化、削弱或使論點失效。這可避免模型對每一個新發展都做出合理化的解釋。
2. 建立來源階層
以美國證券交易委員會(SEC)申報文件、公司投資人關係資料、監管機構公告與直接逐字稿作為主要證據。使用高品質的報導作為背景。將社群貼文與無來源的評論視為線索,而非證明。
記錄發佈時間、事件時間、報導期間與文件版本。當修訂申報或更新指引取代先前資訊時,這些紀錄會變得非常重要。
3. 擷取到結構化欄位
要求欄位例如指標名稱、報告值、單位、貨幣、期間、GAAP 狀態、來源、頁碼或章節與信心水準。結構化擷取比段落式敘述更容易驗證。
當兩家公司對某個指標有不同定義時,儲存兩者的定義,而不要強制比較。
4. 在文本層之外計算
使用程式或試算表來計算成長率、利潤率、估值情境與敏感度分析。保留公式。要求模型說明結果,而不是充當看不見的計算器。
5. 執行矛盾檢查
請另一個流程對初步結論提出反駁。尋找缺失的腳註、基數效應、併購、會計政策變動、客戶集中度、股本稀釋、營運資金時點問題與管理階層的激勵結構。
在此情境下,低成本的代理執行可能特別有價值。更多獨立的檢查可以納入相同的營運預算,前提是它們真正使用不同的證據或角色,而不是重複相同的提示。關於此差異,可參考 AlphaVue 對其 多代理研究系統 的概述。
6. 保存論點版本並觀察下一個觸發事件
當研究報告具有記憶時,它會更有用。保存投資者當時的信念、支持該信念的證據、未解決的風險,以及應觸發檢視的事件。下一次財報發布應更新該記錄,而不是在沒有任何上下文的情況下重新開始一個新的對話。
論點應透過明確的證據更新來演進,而非在每次價格波動後重新改寫。
更大的轉變:模型正在成為組件,而非產品
發布節奏和單一模型同等重要。Gemini 3.7 Flash 在 Gemini 3.6 Flash 之後三週推出。價格、功能和模型名稱的變化速度可能比投資流程應有的速度還快。
這就主張採用一種對模型具有彈性的研究架構。持久的價值不是綁定於某個模型版本的提示,而是圍繞模型的證據系統:來源攝取、文件版本控制、結構化指標、計算、評估集、引用、論點歷史和使用者控制。
一個模型可能最適合做廣泛的文件抽取;另一個可能更適合進行對抗性審查。較小的模型則可以低成本地處理分類。確定性工具應該執行算術運算。哪些假設重要,應由人來決定。
對評估 AI 公司的投資者而言,這一觀察具有戰略意義。模型品質仍然重要,但分發能力、基礎設施成本、工具生態系統、企業整合、專有資料存取以及工作流程所有權,可能決定誰能獲得經濟價值。基準上的領先可能是暫時的;深度嵌入的工作流程則更具耐久性。
Gemini 3.7 Flash 強化了 Google 在高流量 agent 層的地位。它將多模態、長上下文、工具支援與入門價格結合,能鼓勵開發者打造更具雄心的應用。然而,分析 Alphabet 的投資者應避免從模型能力直接推論對收益的影響。財務影響取決於採用率、入門期結束後的定價、推論成本、競爭回應,以及新用量是增量增加還是對既有產品的替代。
因此,這項公告對投資研究的雙方都具有意義。它改變了分析師可使用的工具,並提供了關於 AI 平台市場競爭的新證據。
從有能力的模型到可靠的研究工作流程
這就是專門打造的研究系統與一般聊天機器人的不同之處。
聊天機器人是為回應當前提示而最佳化。投資工作流程必須保留先前發生的情況,並為接下來可能發生的事做好準備。它需要知道使用了哪些文件、哪個論點版本當時生效、哪些假設發生了變化,以及哪些投資組合持倉可能會受到影響。
AlphaVue 是圍繞該工作流程層設計的。它幫助投資人整理 AI 輔助的公司研究,從多個角度檢視投資論點,將結論連結到證據,追蹤新事件發生後案例如何變化,並考量對投組的影響。想了解更廣泛方法的讀者可以參考 AlphaVue 的 AI 選股研究完整指南 以及其對 證據鏈如何讓 AI 分析可被驗證 的說明。其價值並不依賴於聲稱某一通用模型能夠預測股價,而在於讓研究流程更有結構且可檢視。
這一差異也解釋了為何本文並未聲明 AlphaVue 使用 Gemini 3.7 Flash。模型發佈可以影響市場對 AI 研究的看法,但並不等同於特定產品的整合。對投資人來說,重要的是研究環境是否提供具來源意識的分析、揭示分歧,並保留論點的歷史記錄。
未來最強大的系統很可能會把持續改善的基礎模型與應用層的控制結合起來:
- 以原始來源檢索為主,而非僅靠模型記憶回答。
- 採用多重分析角色,而不是單一說服式敘述。
- 可重現的計算結果。
- 同時展示支持與反駁的證據。
- 論點版本可在對話結束後持續保留。
- 監測機制能將新事件與其所影響的假設連結起來。
- 加入投組情境,避免將公司分析誤認為完整的資產配置決策。
Gemini 3.7 Flash 可以讓選擇使用它的開發者在系統的某些部分運行得更快、成本更低,但這並不消除對系統本身的需求。AlphaVue 最近的 投資決策系統與論點監控更新 展示了在首次報告之後如何將研究向前推進。
基礎模型負責生成與推理;研究系統則加入來源、驗證、論點記憶與投組情境。
投資人接下來應關注的要點
最有用的後續證據不會是另一個促銷性的基準測試。投資人與開發者應觀察模型在重複生產任務中的表現。
首先,注意引用準確性。系統能否穩定地將一項主張連結到正確的段落,並包含正確的日期與單位?會檢索到正確文件但引用錯誤段落的模型,會增加隱藏的審查工作。
其次,留意工具調用的可靠性。一個代理可能需要數十個成功步驟才能完成研究任務;在長流程中,即使小幅的失敗率也會被放大。復原行為——辨識錯誤、選擇替代路徑並尋求澄清——與第一次嘗試同等重要。
第三,評估每個驗證後輸出的總成本。Google 的入門代幣價格具有吸引力,但生產成本包括重試、長時間處理、搜尋、資料存取、儲存和人工審核。最便宜的代幣不一定代表最便宜且可信的報告。
第四,測試長上下文的準確性,而非上下文容量。開發者應該衡量隨著文件累積關鍵事實是否仍可被檢索、近期資訊是否獲得正確的優先權,以及系統是否能偵測到衝突的版本。
第五,將領域表現與一般表現分開。模型在程式碼方面表現優異,仍可能需要針對財務表格、會計定義和時間性問題做專門評估。實用的財務評估應包括修正案、非 GAAP 調節、區隔變更、不一致的單位,以及有意誘導但無根據的結論。
最後,留意產品生態系。基礎模型只有在應用將能力轉化為可靠成果時才會創造價值。掌控資料、分發、評估和工作流程的公司,可能會獲取與提供模型的公司不同部分的價值。
結論要點
Gemini 3.7 Flash 對於 AI 股票研究意義重大,因為它同時改善了多個構成要素:多模態文件處理、長上下文分析、結構化工具使用、多步驟執行,以及大規模運行代理的經濟性。
它並未解決投資中最艱難的部分。模型無法保證證據是完整的、論點被妥善框定、估值具有吸引力,或市場會認同。Google 自身的文件也承認存在幻覺與知識範圍限制的風險。負責任的做法不是否定模型,而是將其置於能夠偵測並遏止這些弱點的流程之中。
AI 輔助研究的競爭優勢將來自於將有能力的模型與更好的問題、更高品質的來源、明確的計算、對抗性審查、論點記憶以及有紀律的人類判斷結合。更快的閱讀有用,但更快且可追溯的學習更有價值。
使用 AlphaVue 建立並追蹤以證據為基礎的投資論點。
