Google 延續近期 Flash 模型的強勁推進力道,正式推出了迄今最強大的推理與程式碼生成模型 Gemini 3.8 Flash,並同步帶來兩種專屬版本:主打通用智慧工作的「Gemini 3.8 Flash」以及聚焦防禦性資安應用的「Gemini 3.8 Flash Cyber」。兩者皆立足於相同的底層智慧基石,並透過高強度資安任務與長運行代理迴圈進行嚴格訓練與反覆微調。最引人注目的是,新模型在能力大幅跳躍的同時,依然維持與前代相同的入門定價水準,讓開發者能以極低成本存取接近尖端大模型的強悍戰力。

在核心性能方面,Gemini 3.8 Flash 針對自主代理與端到端工程問題進行了深度特化。在衡量長程軟體工程表現的 DeepSWE v1.1 評測中,該模型展現出超越眾多大型旗艦模型的自主任務執行力,能深入理解架構並獨立完成複雜程式修復。此外,針對金融數據分析(Vals Finance Agent V2)、法律研判(Harvey's Legal Agent Benchmark)以及涵蓋理工與人文領域的跨學科多步推理(HLE-Verified),3.8 Flash 均表現出卓越的穩定度與嚴謹度。模型運作機制更強調反覆驗證與工具調用,在面對高難度工作時願意投入更多運算步驟,開發者亦可依據即時性需求彈性調節運算力度。
| 模型版本 | 主要定位與特點 | 關鍵評測與亮點數據 | 主要支援生態與管道 |
|---|---|---|---|
| Gemini 3.8 Flash | 主力通用工作模型,針對長程程式碼開發、專業領域多步推理與自主代理工作流程打造。 | DeepSWE v1.1 表現優異;HLE-Verified 達 54.9%;Vals 財務與 Harvey 法律代理基準領先。 | Google AI Studio、Antigravity、Android Studio、Stitch、Gemini Enterprise、Google AI 訂閱服務。 |
| Gemini 3.8 Flash Cyber | 高階防禦型資安特化模型,專注於全自主漏洞探勘與程式碼自動修補,向防護端強烈傾斜。 | 跨 20 種程式語言內部漏洞檢測成功率突破 70%;CWE-Bench 修補 Pass@1 達 47.2%。 | Fairwind 計畫專屬通道(優先提供給政府機關、關鍵基礎設施維運商與關鍵軟體維護者)。 |
與此同時,專為資安防護人員打造的 Gemini 3.8 Flash Cyber 則在防禦生態中掀起嶄新突破。相較於容易遭濫用的攻擊性技術,Google 策略性地將研發焦點鎖定於自動化漏洞探查與修補上。該模型不僅在 CyberGym 上超越規模更大的模型,更在跨 20 種程式語言的複雜專案內部評測中斬獲逾 70% 的漏洞發現成功率。在 Google 內部實戰中,Chrome 安全團隊驗證其產出正確修補程式的數量達大型商用模型的 2.6 倍,雲端研究人員更在兩小時內成功定位出過往需耗時數月才能釐清的底層重大漏洞。搭配嚴格的前沿安全架構(Frontier Safety Framework)與提示詞注入防禦,這兩款新模型將從消費端、企業雲端到關鍵基礎設施全面賦能新一代 AI 實踐。
《上一篇》【特力屋】經濟型環保精緻批土 百合白 5kg 









留言區 / Comments
萌芽論壇