Thinking Machines 在 Inkling 原模型問世僅僅兩週,就甩出了 Inkling-Small。276B 總參數、12B 活躍參數,效能緊咬原版的 975B 旗艦,卻把授權換成對企業最友善的 Apache 2.0。我從來不相信行銷名稱裡的「Small」,這東西在筆電上根本跑不動,600GB 的 VRAM 門檻直接勸退消費級用戶。但對企業來說,這根本是一記漂亮的空間換時間:用四分之一的運算成本,買到幾乎等價的推理與程式碼能力。這不是一次研究計畫的意外收穫,而是 Mira Murati 團隊把模型生產線從「手工藝」升級成「標準化廠牌」的明確訊號。
談到 benchmark,大家總是著迷於分數的微小差距。Artificial Analysis 給 Inkling-Small 打了 40 分,原版是 41。聽起來很險,但仔細看細項會發現一個有趣的現象:這模型在 SWE-bench 上拿到 80.2%,直接暴打原版的 77.6%。編程、邏輯推理、多模態處理它都不輸,甚至在 Humanity’s Last Exam 和 GPQA Diamond 都小勝。反過來說,事實性知識的弱點暴露無遺,τ³-Banking 只有 15.5%,原版有 23.7%。這其實很合理,因為企業真正的痛點從來不是「背誦資料庫」,而是「能不能寫出可執行的程式、能不能處理長上下文文件」。把事實性知識的短板交給 RAG 和人工覆核,換取極低的部署門檻與推理成本,這筆帳算得很清楚。
我覺得這波最大的贏家根本不是技術團隊,而是企業的 採購與法務部門。過去幾年各家 AI 公司砸出「open weight」,但授權條款寫得像迷宮。Moonshot 的 Kimi K3 自訂授權就加了營收門檻與品牌標示義務。Apache 2.0 是什麼?修改、商用、內建到封閉型產品裡,只要保留聲明就好。 這讓法務團隊終於不用為了跑一個 fine-tune 的模型開三次跨部門會議。輸家呢?當然是那些還在賣「旗艦級閉源模型」且授權費昂貴的雲端服務商。Inkling-Small 的 API 定價在五折優惠後,輸入每百萬 token 只要 0.58 美元、輸出 1.44 美元。這價格打著 Apache 2.0 的旗號下去,自有 GPU 機櫃的企業會開始認真考慮 self-hosting。
「Small 是相對於
Inkling而言,不是相對於你的 MacBook。」這句大实话,道出了當前 AI 模型脫離實驗室、硬塞進企業資料中心的真實現狀。
我們來整理一下這波變動的實質影響:
| 維度 | Inkling-Small 的實際定位 |
對企業的影響 |
|---|---|---|
| 授權 | Apache 2.0 開放授權 |
法務門檻大幅降低,商用修改零摩擦 |
| 硬體門檻 | BF16 需 600GB VRAM / NVFP4 約 180GB | 消費級筆電別想,企業級 GPU 伺服器才是目標客群 |
| 效能取捨 | 程式碼/推理強,事實性知識弱 | 適合 RAG、Agent、文件分析;高風險背書仍需人工覆核 |
| 生產週期 | 兩週內從原版迭代出第二代 | 模型更新從「專案制」轉為「流水線制」 |
背後隱藏的盲點其實很明顯。稀疏 MoE 架構讓 276B 參數每次只動用 12B,這確實省電省錢,但 上下文窗口拉到 100 萬 token 時,推理延遲與記憶體佔用會呈現非線性增長。很多企業現在衝著「1M context」的名號進場,等到真正塞進長篇合約或大量日誌時,可能會發現量化後的 NVFP4 版本在精度與速度之間又要重新做取捨。另外,Tinker API 雖然開放 fine-tune,但對沒有 ML Ops 團隊的中型公司來說,從部署 SGLang、vLLM 到對齊資料管道,中間的工程量可能比預期的大。
說到底,Inkling-Small 不是在跟消費級用戶搶筆電市場,它是一封投給企業資料中心的戰書。Mira Murati 團隊用兩週時間證明了一件事:開源模型已經過了「秀肌肉」的階段,現在進入「拼授權、拼部署成本、拼迭代速度」的實戰期。下次再看到「Small」,別急著找筆電,先翻翻採購預算跟法務手冊。
延伸思考與常見問題
Q1:MoE(混合專家)架構是什麼,為什麼總參數 276B 卻只有 12B 活躍? 答:MoE 架構將模型拆分成數百個專門的「專家」網路,每次處理一個 token 時,路由機制只會啟用其中少數幾個專家(例如 6 個專業專家加 2 個共享專家)。這讓模型擁有龐大的知識儲備,但每次推理只需計算一小部分參數,從而大幅降低運算成本與延遲。
Q2:Apache 2.0 授權對企業來說,具體比許多 AI 公司的「自訂開源」好在哪? 答:Apache 2.0 允許企業自由修改、再分发與商用,甚至內建到封閉型 proprietary 產品中,只需保留版權聲明即可。相較之下,許多 AI 公司的自訂授權常附帶營收門檻、品牌標示義務或使用場景限制,Apache 2.0 讓法務與採購團隊的審查流程簡化許多。
Q3:Inkling-Small 的 API 定價在優惠後具體是多少,企業 self-hosting 的硬體門檻為何? 答:五折優惠後,標準 64K 上下文版本的 API 價格為輸入每百萬 token 0.58 美元、輸出 1.44 美元、訓練 1.73 美元,快取請求僅 0.116 美元。若選擇 self-hosting,BF16 精確度需至少 600GB 累積 VRAM(如 4 張 B300 或 8 張 H200),量化版 NVFP4 則需約 180GB,完全不在消費級筆電的射程範圍內。