※ 引述《kimisawa (楊回血了。)》之銘言: : YT Lon.TV 測了B70用ComfyUI跑 minimax : https://www.youtube.com/watch?v=HfevkEZ8w5Q : 看起來VRAM大的優勢在這邊體現出來,無速度法跟NVIDA比, : 不過NVIDIA要32G的價格就很不舒服了 : B70生480p 5秒大概 2分半 : 生圖 1024x1024 大概 34秒 : 他還測了許多其他用途與模型,影片搭聲音,coding,等等 : 另外大vram的好處是跑LLM : https://www.youtube.com/watch?v=bLac7-toF68&t=363s : Lon.TV 跑Qwen3.8可以全部放在vram 大概 25 token/s : 亞馬遜的價錢 :

: 退一步B60 24G VRAM可以放絕大部分的模型只有B70一半的價錢 : 不過I卡的問題是待機功耗,待機要吃到50W有點高啊 : 單跑AI或許'目前'i卡是一種選擇?N卡的性價比實在太差了
在下做了 Qwen3.8 27B 的測試, 簡單的結論如下
- 推薦模型: unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL
- 編譯 llama.cpp 建議用 F16 with oneDNN 那組編譯選項
- 啟動 llama.cpp 建議不要改 -ctk -ctv, 預設 f16 的 kv cache 速度較快
測試報告可以參考 llama.cpp 討論區, 我寫了幾篇 B70 的測試結果
https://github.com/ggml-org/llama.cpp/discussions/23313#discussioncomment-182299
目前搭配 ZooCode, axe, AnythingLLM 等 Agent 使用 邏輯複雜的任務, 需要搭配 MCP 使用, 邏輯簡單手續複雜的任務可以直接做 以目前測試結果, 應該已經接近榨乾 B70 SYCL 性能 接下來會再研究 OVMS 與 OpenVINO IR 量化, 看能不能進一步提升效能
-- 世界越快 心則慢 網路越慢 心則快
--
留言
推 World5566:潮 09/02 14:50
推 yymeow:推個 09/02 15:24
推 d0178411:看嘸 還是推 09/02 15:57
推 dog41125:想請問你的電源方面有調整嗎?還是上下 09/02 16:00
→ dog41125:文的設計,我也是用B70跑Qwen一定當機, 09/02 16:00
→ dog41125:現在用gemma27B穩定跑 09/02 16:00
推 d030b:感謝分享 09/02 18:17
→ necrophagist:Gemma是26Ba4b moe 和qwen 27b den 09/02 19:14
→ necrophagist:se模型要能順跑的難度差很多 09/02 19:14
推 px172:謝謝分享 09/02 19:25
推 saito2190:建議用Q4,Q3Q5不能被2整除 有時候反 09/02 20:41
→ saito2190:而會跑更慢 09/02 20:41
推 sdbb:謝謝 09/02 22:55
推 YCL13:很多人調KV的目的是要加大上下文容量 09/02 23:19
推 jhjhs33504:調整KV型態要海量數學配套不然不夠準 09/03 00:50
推 saito2190:B70居然跟Q4不合嗎...感謝情報,讓我 09/03 05:39
→ saito2190:也想買一張B70回來研究研究 09/03 05:39