昨晚,矽谷經歷了AI諸神之戰
作者:Max,01 Founder
編輯:Max
昨天夜裡的矽谷發生了三件大事。
Google 發布了 Gemini 3.8 Flash,Meta 發布了 Muse Spark 1.3,一家此前沒人討論過的初創公司 Mostik 則登上了權威媒體 WIRED 的專訪。
如果只看前兩件,這很像又一個普通的 AI 刷榜之夜。
Google 剛剛把 Gemini 推上 DeepSWE 榜首,幾個小時之後,Meta 又公布了更高的成績,世界第一的頭銜甚至只維持了幾個小時。
這種事情到了 2026 年,大家甚至已經快麻木了。
模型發布、benchmark 刷新、X 上慶祝幾個小時,然後等待下一家公司繼續刷新。
但如果把昨天晚上這三件事連起來看,我覺得真正值得關注的東西完全不在那些榜單上。
AI 的經濟學正在發生突變。
過去幾年,我們討論 AI 成本,最常看的數字都是每百萬 token 多少錢。
但 Agent 出現以後,這套計量方式正在變得越來越不夠用。
未來真正重要的問題可能不是「一百萬 token 多少錢」,而是修好一個 Bug 多少錢、完成一份研究多少錢、讓一個 Agent 連續工作三個小時到底多少錢。
而昨天晚上,推理成本正在從幾個完全不同的方向同時往下降。
Google 在把 frontier 級別的能力塞進越來越便宜的模型,Meta 在讓 Agent 用更少的 token 和工具調用完成同一任務,而 Mostik 更進一步,他們開始質疑:
如果通信的雙方本來都是 AI,模型之間為什麼還需要用為人類設計的語言交流?
PART.01、Gemini 殺回來了
先看 Google。
Google發布了他們全新的旗艦模型Gemini 3.8 Flash,官方稱之為這是他們迄今為止最強大的推理與代碼模型。
這也是 Google 在六週時間內對 Flash 系列的第三次更新,從 3.6 到 3.7,再到現在的 3.8。
過去 Flash 給人的印象一直非常簡單:更快、更便宜,但能力會比最強模型差一些。
Google 現在正在一點點改變這個定義。
這一次 3.8 Flash 最核心的提升集中在 long-horizon coding 和 agentic workflow。
在衡量 AI 長周期軟件工程能力的 DeepSWE v1.1 上,它拿到了約 74% 的成績。
DeepSWE 和傳統代碼 benchmark 最大的區別在於,它不是扔給模型一道算法題,而是真的把 Agent 放進一個代碼倉庫裡。
模型需要理解問題、搜索代碼、修改文件、調用工具、運行測試,失敗以後繼續尋找原因。
一個完整任務可能持續幾十甚至上百步。
在這樣的測試裡,Gemini 3.8 Flash 一度登上世界第一。
Claude Opus 5 同樣大約是 74%,GPT-5.6 Sol 大約 73%,此前領先的 Fable 5 大約 70%。
如果只看能力,這幾個最強模型之間已經沒有特別巨大的差距。
真正恐怖的是另外一個數字:錢。
Gemini 3.8 Flash 的 API 首發價格依然保持在輸入 0.75 美元 / 1M token、輸出 3.75 美元 / 1M token。
在 DeepSWE 上完成一道完整任務,它的平均成本只有 2.36 美元。
作為對比,同樣約 74% 的 Claude Opus 5,單任務平均成本達到 11.84 美元;GPT-5.6 Sol 約 73%,平均成本也要 6.46 美元。
也就是說,同一級別的軟件工程能力,執行成本已經可以差幾倍。
這在 Agent 時代會變得非常重要。
聊天機器人時代,一次回答貴幾分錢還是便宜幾分錢,普通用戶基本沒有感知。
但 Agent 完全不一樣,一個 coding agent 可能連續運行 100 步,一個 research agent 可能搜索幾十個網頁、閱讀幾百頁資料,未來企業裡的 Agent 甚至可能連續工作幾個小時。
Google 官方甚至提到,3.8 Flash 遇到複雜任務時會主動 work harder,進行更多推理和工具調用。
Google 沒有為了省錢讓模型「少思考」,而是因為 token 已經足夠便宜,所以可以允許它跑更長的 loop。
所以我覺得 3.8 Flash 真正重要的地方不是又拿了一次世界第一。
而是它正在把過去只有最昂貴 frontier model 才能提供的能力,硬生生壓進 Flash 的價格區間。
PART.02、三個半小時後Meta殺回來了
正在 Google 眾為 Gemini 3.8 Flash 的發布慶祝時,Meta 突然殺回來了。
Meta 突然發布了Muse Spark 1.3 模型。
按 Meta 公布的評測,Muse Spark 1.3 在 DeepSWE v1.1 上的成績達到了 75.4%。
這個數字超過了 Gemini 3.8 Flash、Claude Opus 5 和 GPT-5.6 Sol。
更誇張的是,Muse Spark 1.2 在這個測試上的成績還只有約 55%。
從 1.2 到 1.3,一個小版本更新直接提升了約 20 個百分點。
但我覺得 Meta 這次真正值得看的同樣不是 75.4%。
還有兩個數字:工具調用減少約 20%,token 消耗減少約 25%。
這件事很容易被忽略,但它其實非常接近 Agent 真正商業化以後最重要的問題。
一個 Agent 最浪費錢的地方,很多時候不是正常思考,而是跑偏。
比如 coding agent 在第 20 步錯誤理解了需求,它可能繼續修改五個文件、運行三輪測試、搜索大量代碼,最後才發現路線錯了,然後全部重來。
幾十次 tool call 和幾萬 token 就這麼浪費掉了。
所以一個模型如果能夠更早發現任務存在歧義、更早知道自己做不下去、更早詢問用戶,實際上就是在直接降低成本。
Muse Spark 1.3 這次強化的很多能力都屬於這一類:它能在長 thread 裡同時維護多個 workflow,遇到模糊任務主動詢問,解決不了的問題主動請求幫助,涉及不可逆操作先確認,而且長任務運行很多輪以後也更不容易忘記最開始的約束。
Meta 甚至開始強調模型對自己能力邊界的認識:知道自己會什麼,也知道自己不會什麼。
這些能力放在 Chatbot 時代可能沒有 benchmark 漲 20 分那麼性感,但到了 Agent 時代,它們都可以直接換算成錢。
Agent 少犯一次錯誤,本身就是一次推理優化。
所以把 Google 和 Meta 放在一起看,大模型競爭的計量單位正在悄悄發生變化。
以後大家可能越來越少關心「一百萬 token 多少錢」,而越來越關心另一個數字:
把一個真實任務從頭跑到尾,到底多少錢。
PART.03、Mostik,一個顛覆性的突破
如果 Google 和 Meta 還在研究如何用更便宜、更少的 token 完成任務,那麼 Mostik 開始碰一個更加底層的問題:
這些 token 為什麼一定要存在?
Mostik 在俄語裡的意思是「橋」。
CEO Sasha Malysheva 是這套方法的主要開發者,它的首席科學家則是日內瓦大學教授、2010 年菲爾茲獎得主 Stanislav Smirnov。
他們正在嘗試做一件聽起來很簡單、實際上極其困難的事情:讓兩個 AI 模型不再通過自然語言互相交流。
今天絕大多數 Multi-Agent 系統都是這麼工作的:
Model A 得到一些信息以後,先生成幾百甚至幾千個 token,把自己的結論用自然語言說出來;Model B 再把這些文字全部讀進去,重新理解並建立自己的內部表示,然後繼續推理。
但問題在於,大模型內部真正進行計算的東西,本來就不是中文或者英文,而是:
高維連續的數學表示。
這就相當於兩台電腦明明可以直接傳數據,電腦 A 卻先把文件打印成幾百頁紙,再讓電腦 B 用攝像頭一頁一頁 OCR 回去。
大家過去一直在研究怎麼把打印費降下來,Mostik 想乾脆把打印機扔掉。
他們試圖在不同模型的內部表示之間建立一座 Bridge,讓模型直接交換 latent representation,而不是先生成自然語言。
矽谷權威媒體 WIRED 披露的一個實驗非常有意思。
Mostik 把完整版的 GLM-5.2 753B 和只有 4B、可以運行在移動設備上的 Qwen 3.5 進行了橋接。
最後得到的混合系統,能力落在兩個模型之間,但推理成本只有完整 GLM-5.2 的 1/20。
當然,現在就說 Mostik 已經解決了模型通信肯定太早。
Latent communication 本身也不是昨天第一次出現,過去幾年已經有不少研究嘗試交換 embedding、hidden state、KV cache 等內部表示。
真正困難的是,不同模型的架構、參數、訓練數據和內部坐標系都不一樣,怎麼讓兩個模型真正理解彼此的 latent space,本身就是一個非常困難的問題。
Smirnov 自己也承認,目前甚至還缺少成熟的數學語言來描述不同模型之間的共同表示。
但 1/20 這個數字還是讓我非常興奮。
因為它讓我開始認真思考一種完全不同的未來 AI 架構。
PART.04、未來你只需要一個零點幾B模型
過去兩年討論端側 AI,我們一直在研究怎麼把更大的模型塞進手機:7B、4B、3B、1B,不斷蒸餾、量化、壓縮。
但如果 Mostik 這條路線最後真的能夠跑通,我覺得未來的手機也許根本不需要一個「什麼都有」的大模型。
你的設備裡可能只需要運行一個 0.xB 或幾 B 的小模型。
它很便宜,可以持續運行,負責理解你當前在哪個 App、剛剛做過什麼、設備是什麼狀態,並且處理絕大多數簡單、高頻的任務。
真正碰到困難的問題,再通過潛空間的通信調用遠程的大模型。
但關鍵區別在於,它不用像今天這樣,把十萬 token 的 Context 全部重新發送到雲端,讓遠端模型從頭讀一遍。
它可能只需要傳輸一段高度壓縮的 latent state。
遠端的大模型完成複雜推理以後,也不一定需要再生成幾千 token 的自然語言解釋給本地模型,而是直接把新的內部表示傳回來。
這樣一來,本地的小模型負責高頻、廉價、持續運行,雲端 frontier model 只負責低頻但真正困難的推理,中間再用某種 Bridge 高效通信。
如果未來真的能做到這一點,推理成本下降的幅度可能就遠不只是今天模型 API 降價 30% 或者 50%。
它可能會改變我們組織 AI 計算本身的方式。
PART.05、結語
所以回頭看昨天晚上,表面上是三條完全不同的新聞。
Google 發布 Gemini 3.8 Flash,把 frontier 級別的能力壓進了 Flash 的價格區間;
Meta 發布 Muse Spark 1.3,讓 Agent 用更少的 token 和 tool call 完成更多事情;
Mostik 則更進一步,開始嘗試讓模型之間的一部分 token 從一開始就不要產生。
它們其實都指向同一個變化:
智能正在以非常誇張的速度變得便宜。
而且這種降價已經不只是 API 單價下降。
模型價格在下降,完成任務所需要的計算量在下降,現在甚至連模型之間交換信息的方式都開始被重新設計。
這件事最後可能帶來的影響,比 benchmark 又漲幾個百分點大得多。
因為很多技術真正爆發,從來不是發生在「第一次能用」的時候,而是發生在「終於便宜到可以隨便用」的時候。
今天讓一個 Agent 花幾十美元去完成一件普通人的小任務,也許完全不划算。
如果未來只需要幾毛錢,很多現在根本不會有人考慮的應用突然就成立了。
今天我們不可能讓幾十個 Agent 24 小時圍繞一個人持續運行,如果推理成本再下降一兩個數量級,它可能就會成為默認狀態。
現在已經早上七點了,我本來幾個小时前就應該睡了。
結果 Gemini 發完,Meta 幾個小時之後又追了上來,然後我又看到了 Mostik 那個 1/20 的實驗。
我躺到床上以後腦子裡一直在想這幾件事,想到手機裡的 0.xB 模型,想到雲端的大模型,想到它們也許根本不需要再用自然語言互相說話。
越想越睡不著,最後還是爬起來,把這篇文章寫完了。
Gemini 的 74%、Muse 的 75.4%,過幾天可能就會出現新的數字把它們覆蓋掉。
但我現在確實很難平復這種興奮。
因為比起誰又拿了一次世界第一,我越來越在意另一個問題:
這麼聰明的 AI,最後到底可以便宜到什麼程度?
一旦強大的智能真的便宜到可以被隨意調用,我覺得很多今天看起來還非常瘋狂的 AI 產品,可能才剛剛開始。
-- 價格
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

Meta發布Muse Spark 1.3模型,提升個人AI代理性能

Robinhood 爆發,UNI 憑什麼漲

英偉達投資35億美元於聯發科可轉債

DeFi 借貸活躍貸款規模升至 261 億美元,增長近 30%

華碩、微星 RTX Spark 首批機種預訂一空

Spark 啟用新域名 spark.finance,整合借貸功能
![[ETH信件] 格拉姆斯特丹即將來臨,基金會招聘及資金明細公開](/public-static/14_1ee1df8c36.png?format=avif)
[ETH信件] 格拉姆斯特丹即將來臨,基金會招聘及資金明細公開

NVIDIA宣布擴展CUDA-X庫

Meta推出AI編碼工具Muse Code,代幣使用費用降低80%

Muse Spark 1.2 Contributor 版本限時免費

AI 競爭三軸重組,開放權重成本壓力加大

谷歌為大學生提供一年免費 Google AI 訂閱

聯想計劃於下半年推出搭載NVIDIA RTX AI晶片的電腦

融資週報 | 萬事達卡收購穩定幣基礎設施公司BVNK;Yellow Card完成4000萬美元戰略融資,渣打、索尼等參投

Spark Q2 財報:總收益 4060 萬美元,分發業務收入 453 萬美元

27小時內消退的‘上市熱潮’…數據揭示國內交易所的真實面貌

融資週報 | 亞馬遜已向OpenAI投資500億美元;Axis Robotics完成1200萬美元種子輪融資

Brale推出ION協議解決穩定幣流動性瓶頸

All-In最新精華:Anthropic IPO對決OpenAI,揭秘AI真實ROI、中國模型出口限制與全民持股

191,958,411 SUSDS 轉移至 Spark

Polymarket 上線比特幣閃電網路即時充值,接入 Spark 協議

Polymarket 支援比特幣閃電網路即時充值,接入 Spark 協議

美股三大股指低開,英偉達漲 2.7% 進軍處理器市場

數據:某巨鯨 1 小時前割肉清倉 8424 枚 ETH,損失 225 萬美元

谷歌正式宣戰

Gemini 3.5來了!今夜,谷歌親手淘汰谷歌

數據:rsETH 黑客事件後 ETH 循環槓桿需求明顯降溫

疑似孫宇晨地址再次從 Spark 撤出 320 萬枚 USDT

早報 | Aethir 承接 Axe Compute 2.6 億美元企業級合同;新火科技收購 Avenir Group 交易團隊;Polymarket 交易量被 Kalshi 反超












