工作筆記 · 思想札記

AI 落地的美麗與哀愁

從百萬美元 Token 不限量實驗出發,探討 AI 產出超越人類注意力與驗證能力後,企業組織面臨的成本、協作與治理瓶頸。

美研芒格君(X @Kay2289123)分享了一篇有關 AI 落地的經驗推文,引起很大的迴響

目前我在矽谷的 AI 訓練/推理大廠帶領一個 20 多人的團隊,跟公司申請了預算 100 萬美元,進行 Token 不限量的激進實驗,這個帖子分享我在一線的使用認知和結論。

結論是:Token 不限量不切實際,比人類貴很多,反而造成了在組織效率提升上,遭遇了明顯的邊際效益門檻。

我預計 AI 真正的上行空間不在於單個組織消耗 token 沖破天際線,而在於基本的大盤子從 0 到 1 開始到 AI token 使用。AI 現在無法落地,有很大一部分是因為我們的公司不夠 AI native,整個組織架構還是為人而設計的。因此,AI 的無預算上線使用出現了水土不服。

先說數據:最多的成員單日花費 Token $7,000,團隊中位數 $2,000。大家最喜歡的模型是 GPT-5.6 Sol Fast 和 Fable 5 Fast。算下來超過了大部分人的月工資,不可持續。

今天跟團隊每個成員都 1 對 1 談過,說幾個共性問題:

  • 團隊成員普遍反映比之前更累,真的很累,工資沒變,幹的活反而更多。

    在等待推理過程中,團隊成員中位數大概會開 5 個 session 並行去使用,context 不斷地轉換,這對於人腦是一個很大的挑戰。此外,人類去 review AI 產生的大量工作,也帶來了非常大的負擔。

  • 未必所有工作都需要貴模型。模型路由非常關鍵,但便宜模型未必真的便宜。

    成員通常會將一些更偏向於快問快答、前期調研的任務交給 Grok 4.5(便宜、快)。雖然等待時間更短,但來回反覆的次數更多。很多貴模型一次能完成的事情,便宜模型要來回迭代,再加上之前多個 session 並行,反而造成了一種負擔。總的調用量換算成價格,甚至比貴模型更貴。

  • 團隊的會議數上個月環比減少了將近 80%,整個團隊好像變成了 AI 跟 AI 在對話工作。

    很多團隊成員將自己的大腦都託管給 AI 了,因此有的時候對項目的細節掌握度、理解度都不夠。在會上別人問什麼問題,人類完全無法 real-time 回答,所以更多地變成了 offline 的溝通方式——因為在 offline 情況下,收到問題之後才能去問 AI,然後再進行回答。個別情況下,群裡出現了 AI 一通亂答,對面的 AI 再一通亂答,兩個人直接聊偏的情況。

原推出處:美研芒格君的 X 貼文

我請 ChatGPT-5.6 Sol High 就上面推文評論如下

我對這篇帖子的評價相當高,但我會把它的核心結論稍微改寫。

它表面上是在說:

Token 不限量不切實際,AI 甚至可能比人還貴。

我認為它真正揭露的是:

當 AI 的工作產生速度(generation bandwidth)超過人類的理解、審查與決策速度(verification bandwidth),AI 生產力就會撞上新的瓶頸。

所以這不是單純的「Token economics」,而是一個很典型的 Human–AI system architecture 問題

一、這個實驗其實非常有價值

如果文中的數字屬實,這是一個很好的極端壓力測試。

目前 GPT-5.6 Sol 的公開 API 價格約為 input $5/M、output $30/M tokens;Claude Fable 5 是 $10/M、$50/M;Grok 4.5 則約 $2/M、$6/M。(OpenAI Developers)

所以每天燒掉數千美元,在「多 Agent + 長 context + 長時間 reasoning + tool calls + 不斷 retry」的模式下並非不可想像。

而且帖子裡有一個數字值得注意:

如果「團隊中位數 $2,000」指的是每人每天,20 人、20 個工作日粗略乘一下就是:

$2,000 × 20 × 20 = $800,000/月。

當然,中位數不能直接當平均數,所以不能因此推斷實際總額;但它至少說明為什麼一百萬美元預算也可能很快碰到底。

有趣的是,這反而說明這一百萬美元實驗沒有失敗。

因為它找到了 saturation point。


二、真正出現的不是 Token bottleneck,而是 Attention bottleneck

我認為這是全文最重要的一段:

等待推理過程中,團隊成員中位數大概會開 5 個 session 並行。

乍看之下,這似乎是:

1 human → 5 AI workers

生產力應該增加五倍。

但人的大腦不是 Kubernetes scheduler。

真正發生的可能是:

AI Agent A → interrupt 人

AI Agent B → interrupt 人

AI Agent C → interrupt 人

AI Agent D → interrupt 人

AI Agent E → interrupt 人

最後 human 變成了:

Interrupt Handler

這時 bottleneck 已經從:

AI inference

轉移成:

Human attention → context switching → understanding → verification → decision

這也是為什麼「五個 agent 同時工作」不一定比一個 agent 更有效率。

OpenAI 自己近期公布的資料其實也顯示,重度 Codex 使用者已經能在一天內讓多個 agent 累積執行超過 60 小時的 agent work。也就是說,machine-hours 已經可以遠遠超過 human-hours。(OpenAI)

問題自然變成:

誰來消化這些 machine-hours 的產物?

這才是下一個真正重要的問題。


三、所以「AI 比人貴」其實不是很精確的說法

這是我最不同意作者的地方。

不能單純比較:

AI 每天 $7,000

vs.

工程師每天薪資 $1,000

然後說:

AI 比人貴七倍。

真正應該比較的是:

Cost per Accepted Work Unit

例如:

一個工程師一天完成 1 個 task,成本 $1,000。

AI 花 $5,000,但是完成 20 個經人類驗證後真正 usable 的 tasks。

那麼 AI 還是非常便宜。

反過來:

AI 花 $500 生成 100 個 outputs,但工程師花兩天 review、debug、rewrite,最後只有兩個能用。

那 $500 的模型反而非常昂貴。

因此企業真正要測量的不是:

$/token

甚至不是:

$/AI session

而是:

$/accepted outcome

這一點非常重要。


四、「便宜模型未必便宜」這個觀察,我非常同意

作者這一段很有洞察力。

Grok 4.5 的公開 token 單價確實比 GPT-5.6 Sol 和 Fable 5 低很多。(SpaceXAI Docs)

但是:

Cheap inference ≠ Cheap solution

如果高級模型:

1 prompt → 1 result → accept

而便宜模型:

prompt → wrong → correction → regenerate → context grows → correction → regenerate → human review

最後可能變成:

Cost = Token Cost + Human Attention + Iteration + Latency + Review + Error

其中真正昂貴的很可能不是 Token。

而是:

Human Attention

所以未來的 model router 不應該只是:

「簡單問題 → cheap model」

「困難問題 → expensive model」

而應該預測:

Expected Total Cost

也就是:

哪一個模型最有可能以最低總成本一次完成這個 task?

這比單純按照 token price routing 高明得多。


五、我反而覺得「會議減少 80%」是這篇最值得警惕的訊號

表面上:

Meeting ↓ 80%

非常漂亮。

傳統公司的主管看到這個 KPI 大概很高興。

但是帖子接下來說:

在會上別人問什麼問題,人類無法 real-time 回答,要先回去問 AI。

這就完全改變了意義。

這表示 AI 可能提高了:

Execution throughput

卻降低了:

Human understanding

更麻煩的是降低了:

Shared Mental Model

原本會議的一項重要作用不是傳遞 information,而是讓大家逐漸形成:

「我們到底正在做什麼?」

也就是團隊成員之間的 Model Alignment

如果:

Alice → Alice’s AI

Bob → Bob’s AI

Carol → Carol’s AI

每個人自己和 AI 工作效率都非常高,

但是 Alice、Bob、Carol 大腦中的 project model 開始分岔,

那麼你可能得到一個非常奇怪的組織:

Local productivity ↑↑

Global coherence ↓↓

這就是我認為帖子裡隱藏得最深的一個問題。


六、「AI 跟 AI 對話最後聊偏」其實是 Model Disalignment

這個現象很有意思。

假設:

Human A → Agent A → Agent B → Human B

再來:

Human B → Agent B → Agent A → Human A

每一層都可能有:

context compression

interpretation

assumption

hallucination

goal drift

於是錯誤不只是累加,還可能被彼此合理化。

最後:

A 的 AI 認為 B 是這個意思。

B 的 AI 又根據 A 的 AI 回答。

兩個模型可能形成一套非常 coherent 的討論——

只是跟原始問題已經沒有關係。

這是一種很有意思的:

AI-mediated organizational model drift

也就是:

AI 越會說話,組織反而越需要 Ground Truth。


七、所以真正的 AI-native 組織,不應該只是「每人配很多 Agent」

我認為這也是作者下一步最值得研究的地方。

現在很多公司的想像大約是:

Human organization + AI

也就是原來:

Manager

Engineer

Engineer

變成:

Manager

Engineer

Agent
Agent
Agent
Agent
Agent

這其實仍然是一個 Human-native organization

只是每個人下面突然多了五個超高速員工。

結果當然會累死。

真正的 AI-native architecture 應該重新設計:

             Human

        Goal / Judgment

        ┌──────▼──────┐
        │ Orchestrator │
        └──────┬──────┘

       ┌───────┼───────┐
       ▼       ▼       ▼
     Agent   Agent   Agent
       │       │       │
       └───────┼───────┘

        AI verification

         aggregation

           Human review

關鍵差異是:

不要讓人的大腦直接管理五個 session。

而是讓 AI 管理 AI。

Human 應該留在:

Goal、Value、Judgment、Exception、Final decision

這幾個層級。


八、我會建議這個團隊下一階段不要研究「Token 使用量」,而研究五個指標

如果我是這個實驗的設計者,我會開始量:

  1. Cost per accepted task
  2. Human review minutes per accepted task
  3. First-pass acceptance rate
  4. Average concurrent human-attended sessions
  5. Rework / defect / misunderstanding rate

尤其我會非常重視:

Human Review Time

最近一項對 802 名開發者、196,212 個 PR 的企業研究,也觀察到 AI adoption 之後 throughput 顯著提高,但 reviewer load 大約增加了一倍;另一項超過百萬個 PR 的研究則發現 agent participation 可以讓 review decision 更快,卻不必然改善 review quality。(arXiv)

這和帖子描述的現象非常吻合:

AI 生產東西的速度,正在超過人類 review 東西的速度。


九、因此我會把這篇帖子的結論改成另一句話

原作者說:

Token 不限量不切實際。

我會改成:

Token 不限量本身不是問題;Human Attention 不限量才是不切實際。

甚至可以再推進一步:

AI 時代真正稀缺的資源,可能會從「產生答案的能力」,轉變成「知道哪些答案值得看、值得相信、值得採取行動的能力」。

過去:

Human expensive → computation cheap

現在逐漸變成:

AI cognition cheap → Human attention expensive

所以 AI 下一波巨大的工程機會,可能不是:

「如何讓 Agent 做更多?」

而是:

「如何讓 100 個 Agent 工作,卻只需要人類看最重要的 3 件事?」

這才是我認為這篇文章真正碰到的 frontier。

而帖中「大家變得更累」、「五個 session」、「review 爆量」、「meeting 減少 80%」、「人類答不出 project details」、「AI 跟 AI 聊偏」,其實全部可以用同一個架構解釋:

AI Execution Capacity > Human Attention Capacity

一旦跨過這個點,更多 Token 不再等於更多生產力;更多 Token 甚至可能製造更多需要處理的工作。

這不是 AI scaling 的失敗,而很可能意味著我們開始進入下一個問題:

從 Model Scaling,走向 Organization Scaling。

我認為這才是這篇帖子的真正含金量。