工作筆記 · 思想札記
AI 落地的美麗與哀愁
從百萬美元 Token 不限量實驗出發,探討 AI 產出超越人類注意力與驗證能力後,企業組織面臨的成本、協作與治理瓶頸。
美研芒格君(X @Kay2289123)分享了一篇有關 AI 落地的經驗推文,引起很大的迴響
目前我在矽谷的 AI 訓練/推理大廠帶領一個 20 多人的團隊,跟公司申請了預算 100 萬美元,進行 Token 不限量的激進實驗,這個帖子分享我在一線的使用認知和結論。
結論是:Token 不限量不切實際,比人類貴很多,反而造成了在組織效率提升上,遭遇了明顯的邊際效益門檻。
我預計 AI 真正的上行空間不在於單個組織消耗 token 沖破天際線,而在於基本的大盤子從 0 到 1 開始到 AI token 使用。AI 現在無法落地,有很大一部分是因為我們的公司不夠 AI native,整個組織架構還是為人而設計的。因此,AI 的無預算上線使用出現了水土不服。
先說數據:最多的成員單日花費 Token $7,000,團隊中位數 $2,000。大家最喜歡的模型是 GPT-5.6 Sol Fast 和 Fable 5 Fast。算下來超過了大部分人的月工資,不可持續。
今天跟團隊每個成員都 1 對 1 談過,說幾個共性問題:
-
團隊成員普遍反映比之前更累,真的很累,工資沒變,幹的活反而更多。
在等待推理過程中,團隊成員中位數大概會開 5 個 session 並行去使用,context 不斷地轉換,這對於人腦是一個很大的挑戰。此外,人類去 review AI 產生的大量工作,也帶來了非常大的負擔。
-
未必所有工作都需要貴模型。模型路由非常關鍵,但便宜模型未必真的便宜。
成員通常會將一些更偏向於快問快答、前期調研的任務交給 Grok 4.5(便宜、快)。雖然等待時間更短,但來回反覆的次數更多。很多貴模型一次能完成的事情,便宜模型要來回迭代,再加上之前多個 session 並行,反而造成了一種負擔。總的調用量換算成價格,甚至比貴模型更貴。
-
團隊的會議數上個月環比減少了將近 80%,整個團隊好像變成了 AI 跟 AI 在對話工作。
很多團隊成員將自己的大腦都託管給 AI 了,因此有的時候對項目的細節掌握度、理解度都不夠。在會上別人問什麼問題,人類完全無法 real-time 回答,所以更多地變成了 offline 的溝通方式——因為在 offline 情況下,收到問題之後才能去問 AI,然後再進行回答。個別情況下,群裡出現了 AI 一通亂答,對面的 AI 再一通亂答,兩個人直接聊偏的情況。
原推出處:美研芒格君的 X 貼文
我請 ChatGPT-5.6 Sol High 就上面推文評論如下
我對這篇帖子的評價相當高,但我會把它的核心結論稍微改寫。
它表面上是在說:
Token 不限量不切實際,AI 甚至可能比人還貴。
我認為它真正揭露的是:
當 AI 的工作產生速度(generation bandwidth)超過人類的理解、審查與決策速度(verification bandwidth),AI 生產力就會撞上新的瓶頸。
所以這不是單純的「Token economics」,而是一個很典型的 Human–AI system architecture 問題。
一、這個實驗其實非常有價值
如果文中的數字屬實,這是一個很好的極端壓力測試。
目前 GPT-5.6 Sol 的公開 API 價格約為 input $5/M、output $30/M tokens;Claude Fable 5 是 $10/M、$50/M;Grok 4.5 則約 $2/M、$6/M。(OpenAI Developers)
所以每天燒掉數千美元,在「多 Agent + 長 context + 長時間 reasoning + tool calls + 不斷 retry」的模式下並非不可想像。
而且帖子裡有一個數字值得注意:
如果「團隊中位數 $2,000」指的是每人每天,20 人、20 個工作日粗略乘一下就是:
$2,000 × 20 × 20 = $800,000/月。
當然,中位數不能直接當平均數,所以不能因此推斷實際總額;但它至少說明為什麼一百萬美元預算也可能很快碰到底。
有趣的是,這反而說明這一百萬美元實驗沒有失敗。
因為它找到了 saturation point。
二、真正出現的不是 Token bottleneck,而是 Attention bottleneck
我認為這是全文最重要的一段:
等待推理過程中,團隊成員中位數大概會開 5 個 session 並行。
乍看之下,這似乎是:
1 human → 5 AI workers
生產力應該增加五倍。
但人的大腦不是 Kubernetes scheduler。
真正發生的可能是:
AI Agent A → interrupt 人
AI Agent B → interrupt 人
AI Agent C → interrupt 人
AI Agent D → interrupt 人
AI Agent E → interrupt 人
最後 human 變成了:
Interrupt Handler
這時 bottleneck 已經從:
AI inference
轉移成:
Human attention → context switching → understanding → verification → decision
這也是為什麼「五個 agent 同時工作」不一定比一個 agent 更有效率。
OpenAI 自己近期公布的資料其實也顯示,重度 Codex 使用者已經能在一天內讓多個 agent 累積執行超過 60 小時的 agent work。也就是說,machine-hours 已經可以遠遠超過 human-hours。(OpenAI)
問題自然變成:
誰來消化這些 machine-hours 的產物?
這才是下一個真正重要的問題。
三、所以「AI 比人貴」其實不是很精確的說法
這是我最不同意作者的地方。
不能單純比較:
AI 每天 $7,000
vs.
工程師每天薪資 $1,000
然後說:
AI 比人貴七倍。
真正應該比較的是:
Cost per Accepted Work Unit
例如:
一個工程師一天完成 1 個 task,成本 $1,000。
AI 花 $5,000,但是完成 20 個經人類驗證後真正 usable 的 tasks。
那麼 AI 還是非常便宜。
反過來:
AI 花 $500 生成 100 個 outputs,但工程師花兩天 review、debug、rewrite,最後只有兩個能用。
那 $500 的模型反而非常昂貴。
因此企業真正要測量的不是:
$/token
甚至不是:
$/AI session
而是:
$/accepted outcome
這一點非常重要。
四、「便宜模型未必便宜」這個觀察,我非常同意
作者這一段很有洞察力。
Grok 4.5 的公開 token 單價確實比 GPT-5.6 Sol 和 Fable 5 低很多。(SpaceXAI Docs)
但是:
Cheap inference ≠ Cheap solution
如果高級模型:
1 prompt → 1 result → accept
而便宜模型:
prompt → wrong → correction → regenerate → context grows → correction → regenerate → human review
最後可能變成:
Cost = Token Cost + Human Attention + Iteration + Latency + Review + Error
其中真正昂貴的很可能不是 Token。
而是:
Human Attention
所以未來的 model router 不應該只是:
「簡單問題 → cheap model」
「困難問題 → expensive model」
而應該預測:
Expected Total Cost
也就是:
哪一個模型最有可能以最低總成本一次完成這個 task?
這比單純按照 token price routing 高明得多。
五、我反而覺得「會議減少 80%」是這篇最值得警惕的訊號
表面上:
Meeting ↓ 80%
非常漂亮。
傳統公司的主管看到這個 KPI 大概很高興。
但是帖子接下來說:
在會上別人問什麼問題,人類無法 real-time 回答,要先回去問 AI。
這就完全改變了意義。
這表示 AI 可能提高了:
Execution throughput
卻降低了:
Human understanding
更麻煩的是降低了:
Shared Mental Model
原本會議的一項重要作用不是傳遞 information,而是讓大家逐漸形成:
「我們到底正在做什麼?」
也就是團隊成員之間的 Model Alignment。
如果:
Alice → Alice’s AI
Bob → Bob’s AI
Carol → Carol’s AI
每個人自己和 AI 工作效率都非常高,
但是 Alice、Bob、Carol 大腦中的 project model 開始分岔,
那麼你可能得到一個非常奇怪的組織:
Local productivity ↑↑
Global coherence ↓↓
這就是我認為帖子裡隱藏得最深的一個問題。
六、「AI 跟 AI 對話最後聊偏」其實是 Model Disalignment
這個現象很有意思。
假設:
Human A → Agent A → Agent B → Human B
再來:
Human B → Agent B → Agent A → Human A
每一層都可能有:
context compression
interpretation
assumption
hallucination
goal drift
於是錯誤不只是累加,還可能被彼此合理化。
最後:
A 的 AI 認為 B 是這個意思。
B 的 AI 又根據 A 的 AI 回答。
兩個模型可能形成一套非常 coherent 的討論——
只是跟原始問題已經沒有關係。
這是一種很有意思的:
AI-mediated organizational model drift
也就是:
AI 越會說話,組織反而越需要 Ground Truth。
七、所以真正的 AI-native 組織,不應該只是「每人配很多 Agent」
我認為這也是作者下一步最值得研究的地方。
現在很多公司的想像大約是:
Human organization + AI
也就是原來:
Manager
↓
Engineer
↓
Engineer
變成:
Manager
↓
Engineer
↓
Agent
Agent
Agent
Agent
Agent
這其實仍然是一個 Human-native organization。
只是每個人下面突然多了五個超高速員工。
結果當然會累死。
真正的 AI-native architecture 應該重新設計:
Human
│
Goal / Judgment
│
┌──────▼──────┐
│ Orchestrator │
└──────┬──────┘
│
┌───────┼───────┐
▼ ▼ ▼
Agent Agent Agent
│ │ │
└───────┼───────┘
▼
AI verification
▼
aggregation
▼
Human review
關鍵差異是:
不要讓人的大腦直接管理五個 session。
而是讓 AI 管理 AI。
Human 應該留在:
Goal、Value、Judgment、Exception、Final decision
這幾個層級。
八、我會建議這個團隊下一階段不要研究「Token 使用量」,而研究五個指標
如果我是這個實驗的設計者,我會開始量:
- Cost per accepted task
- Human review minutes per accepted task
- First-pass acceptance rate
- Average concurrent human-attended sessions
- Rework / defect / misunderstanding rate
尤其我會非常重視:
Human Review Time
最近一項對 802 名開發者、196,212 個 PR 的企業研究,也觀察到 AI adoption 之後 throughput 顯著提高,但 reviewer load 大約增加了一倍;另一項超過百萬個 PR 的研究則發現 agent participation 可以讓 review decision 更快,卻不必然改善 review quality。(arXiv)
這和帖子描述的現象非常吻合:
AI 生產東西的速度,正在超過人類 review 東西的速度。
九、因此我會把這篇帖子的結論改成另一句話
原作者說:
Token 不限量不切實際。
我會改成:
Token 不限量本身不是問題;Human Attention 不限量才是不切實際。
甚至可以再推進一步:
AI 時代真正稀缺的資源,可能會從「產生答案的能力」,轉變成「知道哪些答案值得看、值得相信、值得採取行動的能力」。
過去:
Human expensive → computation cheap
現在逐漸變成:
AI cognition cheap → Human attention expensive
所以 AI 下一波巨大的工程機會,可能不是:
「如何讓 Agent 做更多?」
而是:
「如何讓 100 個 Agent 工作,卻只需要人類看最重要的 3 件事?」
這才是我認為這篇文章真正碰到的 frontier。
而帖中「大家變得更累」、「五個 session」、「review 爆量」、「meeting 減少 80%」、「人類答不出 project details」、「AI 跟 AI 聊偏」,其實全部可以用同一個架構解釋:
AI Execution Capacity > Human Attention Capacity
一旦跨過這個點,更多 Token 不再等於更多生產力;更多 Token 甚至可能製造更多需要處理的工作。
這不是 AI scaling 的失敗,而很可能意味著我們開始進入下一個問題:
從 Model Scaling,走向 Organization Scaling。
我認為這才是這篇帖子的真正含金量。
