想像一下,以前你去餐廳吃飯,頂級大廚做的料理(閉源模型)要價不菲,而且你只能看到成品,不知道後廚怎麼炒的。開源模型呢?就像以前大家分享的食譜,便宜好用,但總覺得少了點「大廚的私房技術」,味道差點意思。現在 Moonshot AI 直接端出一盤 2.8 兆參數 的米其林大餐,不僅味道跟大廚做的不相上下,還告訴你:「這道菜怎麼炒的,全公開!」更重要的是,這道菜現在 免費開放 讓大家下載回家自己煮。這種直接把「廚房」搬出來的做法,在 AI 圈子裡可謂是降維打擊。

花不到一塊錢,體驗頂級大腦:Kimi K3 到底憑什麼這麼狂?

說真的,看到 2.8 兆參數 這個數字,我第一反應是:這傢伙吃電量不爆表嗎?但 Moonshot AI 這次顯然不是來湊熱鬧的。他們給 K3 裝了一個 100 萬 token 的上下文窗口,什麼概念?你丟一本厚達好幾千頁的小說進去,它還能幫你摘要重點,不會讀到一半就「斷片」。

更狠的是它的 「思考模式」(Thinking Mode)。這東西就像是給模型裝了一個「慢思考」開關。以前模型回你話,可能是腦子一熱就答了;現在 K3 會在內部先打草稿、推演邏輯,確認沒問題才把答案丟出來。這讓它在處理複雜任務時,表現得越來越像個老練的專家,而不是只會背書的學徒。

而且別忘了,K3 還支援原生視覺理解。你丟張圖過去,它不僅能看懂,還能幫你分析圖裡的細節邏輯。這下子,文字、圖片、邏輯推理,它全包了。

48 小時自己設計晶片?這操作有點狠啊

如果光看跑分(Benchmark),K3 已經很強了。但 Moonshot AI 這次秀了一手「硬功夫」,讓我在螢幕前下巴都快掉下來。

他們讓 K3 一個人,連續自主運作了 48 小時,從頭到尾設計了一顆能跑它自己縮影版的小晶片。沒有人類工程師在旁邊指導,K3 自己查文獻、做架構設計、跑驗證、甚至自己發現問題然後修正。最後產出的晶片雖然只有 4 平方毫米 大,時脈跑到 100 MHz,但模擬結果顯示它能每秒解碼超過 8,700 個 token。

「這哪裡是 AI 在幫人做事?這根本就是 AI 自己在『造人』啊!」

這句話雖然有點誇張,但說明了現在 AI 的能力已經從「單回合問答」跳到了「長程自主執行」。對企業來說,這代表未來的 AI 不再是只會回話的秘書,而是能自己獨立完成一個專案的「技術工人」。

為了讓大家更清楚 K3 在市場上的位置,我整理了一份簡單的對比表。你發現沒,開源和閉源的界線已經模糊到快看不見了。

模型名稱 參數規模 定位 特性亮點
Kimi K3 2.8 兆 開源旗艦 100萬上下文、自主設計晶片演示、價格親民
Claude Fable 5 Max 未公開 閉源頂尖 多任務處理能力極強,目前跑分第一
GPT-5.6 Sol Max 未公開 閉源頂尖 綜合表現穩定,生態系完善
DeepSeek V4 Pro 1.6 兆 開源強敵 性價比之王,此前開源市場的領頭羊

別急著交訂閱費,這波開源策略是有備而來

說到這裡,可能有人會問:「參數這麼大,跑起來很貴吧?」

其實 Moonshot AI 在定價上相當有誠意。K3 的 API 費用是 $3 / 百萬輸入 token,輸出是 $15 / 百萬輸出 token。如果有做快取(Cache),輸入費用直接砍到 $0.30。這價格放在美國那些大廠裡,只能買到中階服務,但 K3 給你的可是頂級的體驗。

而且他們還準備在 7 月 27 日釋放 完整權重(Full Weights)。這意味著什麼?意味著如果你有足夠的 GPU 算力,你可以把 K3 拉回自己公司伺服器上跑,不用看任何人的臉色,也不用擔心 API 突然漲價或改規則。

這背後其實是 Moonshot AI 的一盤大棋。前陣子 DeepSeek 崛起,把 Moonshot 從用戶數第三打到第七,公司一度很慘。但他們沒有選擇跟風做低價內捲,而是反其道而行,直接拿出 2.8 兆參數 的巨物,用「技術硬實力」來搶回場子。這就像是在說:「你要打價格戰?沒關係,我先讓你看看什麼是真正的技術壁壘。」

說個溫馨提醒,雖然 K3 很強,但別忘了「大象」總是需要大草原的。如果你打算在自己的機器上跑這隻 2.8 兆參數的巨獸,記得先確認你的 GPU 記憶體 夠不夠撐。不過對於企業來說,這絕對是一個重新評估 AI 投資策略的好時機。以前覺得開源就是「湊合用」的朋友,現在可以重新考慮看看了。畢竟,當開源模型的性能已經追平甚至超越頂尖閉源系統時,我們選擇的權利,可就變多了。

延伸思考與常見問題

Q1:2.8 兆參數(Trillion Parameters)到底是什麼意思? 答:參數就像是神經網路裡的「記憶點」或「連接線」。數量越多,代表模型在訓練過程中學到的知識、模式和邏輯就越豐富。簡單來說,2.8 兆參數意味著這顆大腦的「容錯率」和「理解深度」都遠高於過去常見的幾十億或幾百億參數模型。

Q2:為什麼 Moonshot AI 選擇在 DeepSeek 崛起後,反而加大力氣推開源? 答:這是一種「以攻代守」的策略。前陣子 DeepSeek 用低價策略打亂了市場節奏,Moonshot AI 為了奪回開發者的心,選擇不跟風打價格戰,而是直接拿出全球最大的開源模型來展示技術硬實力。透過開放完整權重,他們能吸引更多開發者基於 K3 做二次開發,進而鞏固自己的生態系地位。

Q3:Kimi K3 的「思考模式」和一般的對話有什麼不同? 答:一般對話像是「條件反射」,問什麼答什麼;而「思考模式」就像是人類在回答複雜問題前的「內心獨白」。模型會在內部先進行多步驟的邏輯推演、自我檢查,確認答案準確且邏輯通順後,才將最終結果呈現給使用者。這讓它在處理數學、程式碼或長篇分析時,出錯率會大幅降低。