
rgfxV100かMI50試してもらってどうぞ、もしくは cloud.vast.ai
2026/09/08 11:17

kenzy_nコストやメモリとの競争。
2026/09/08 11:39

naozane2qwen3.8−27B(Q4KM)なら激安のRTX3060の2枚刺し(合計VRAM24GB)で十分動く。
2026/09/08 12:06★

yarumato“NVIDIAは16GB(10万円)が自分の限界で、その上の24GB~32GB(30万〜90万円)には手が出ない。長文チャットにおいて、vLLM(AWQ)とOllama(GGUF)ではメモリの使い方が根本的に異なる。”
2026/09/08 12:40★

strawberryhunter精度という意味でそんなに良いモデルではないように思うんだけど、どうなんだろう。実測ではQwen3.6-35B-A3Bより遅くて精度は同等くらいにしかなっていない。3.8の35B-A3Bは出なさそう。正直見切り付けてるけど何か悔しい。
2026/09/08 12:46

star_123技術力無い私はUnslothDesktopに ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF:IQ2_S ってモデルを繋いでOpenCodeで動かしてる、48tok/sぐらい出るけどvisionモデルがVRAMに入らない。あとはFreeTokenで35BMoEも良く使う
2026/09/08 12:51★

igni3外に出したくないとかじゃない限り、OpenAIとかに課金した方が良いよなって気になってきてる
2026/09/08 13:49

toaruRFreeTokenではなかった\(^o^)/メインメモリ64くらい+12,16GBグラボ+FreeTokenの例が欲しいよねぇ……自分でやれか
2026/09/08 14:09

rawwell“「Ollama(llama.cpp)がロード前に行うVRAM見積もりが、実際に安全に使える余地よりもかなり保守的だった」”
2026/09/08 15:50
