Qwen3.8-27Bが公開 海外「意味を持つ唯一のベンチマークは自分のものだけ」
Alibaba が小型のオープンモデル「Qwen3.8-27B」を公開した。海外の技術系掲示板Hacker Newsでは、27Bという規模で上位モデルと張り合うベンチマーク結果と、手元のGPUでどれだけ速度が出るかに関心が集まった。
Qwen3.8-27B(Qwenチームによる公開告知)
We promised open weights for Qwen3.8. Now, time to meet them! 🎉
— Qwen (@Alibaba_Qwen) August 14, 2026
⚡ Qwen3.8-27B:
– A native multimodal dense model. With just 27B parameters, it outperforms Qwen3.7-Plus overall and shines in real-world coding & office workflows.
– 262K native context, easily extendable to 1M… pic.twitter.com/QuN8oWkG4C出典: twitter.com / 元記事はこちら
DeepSWE で Opus 4.7 Max(Claude Code 使用)を上回っている(42.2 対 40)。Qwen の27Bモデルは相変わらず力がある。
Unsloth の GGUF 量子化版が上がっている: https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
Unsloth の GGUF 量子化版が上がっている: https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
>>3
Unsloth のモデルを使うのは、公式の https://huggingface.co/Qwen/Qwen3.8-27B-FP8 と比べて何か利点があるんだろうか?
Unsloth のモデルを使うのは、公式の https://huggingface.co/Qwen/Qwen3.8-27B-FP8 と比べて何か利点があるんだろうか?
>>3
量子化版それぞれを、元のモデルと同じテストでベンチマークしてほしい。そうすれば性能を比較できるのに。
量子化版それぞれを、元のモデルと同じテストでベンチマークしてほしい。そうすれば性能を比較できるのに。
>>3
サイズ差が圧倒的なことを考えると、これは驚異的だ。もっとも、小さいQwenモデルが階級以上の力を出すのは知られている話ではある。
サイズ差が圧倒的なことを考えると、これは驚異的だ。もっとも、小さいQwenモデルが階級以上の力を出すのは知られている話ではある。
新しい 35B A3B か、それに類する MoE モデルが出てほしくてたまらない。80B A3B だった Qwen 3 Coder Next も惜しかった。VRAM はあるが TDP や演算性能が足りない、という状況では 100B 未満の非密モデルがちょうどいい落としどころになる場面がかなりある。中間として A5B でも A8B でも、なんなら A10B でも喜んで使う。
ログインせずに画像を見るための代替リンク: https://xcancel.com/Alibaba_Qwen/status/2088280182356611304
ログインせずに画像を見るための代替リンク: https://xcancel.com/Alibaba_Qwen/status/2088280182356611304
>>4
> 中間として A5B でも A8B でも
みんなアクティブパラメータ数にこだわっているのは何なんだ? 重みをいじったりしているのか?
> 中間として A5B でも A8B でも
みんなアクティブパラメータ数にこだわっているのは何なんだ? 重みをいじったりしているのか?
>>45
総パラメータ数は必要なVRAM量を決め、アクティブパラメータ数は動作速度を決める。うちの10年前のGPUは量子化した35Bや27Bを読み込めるが、1トークンあたり27Bパラメータを処理する速度は2〜4トークン/秒しか出ない。一方 A3B なら40トークン/秒以上出る。
総パラメータ数は必要なVRAM量を決め、アクティブパラメータ数は動作速度を決める。うちの10年前のGPUは量子化した35Bや27Bを読み込めるが、1トークンあたり27Bパラメータを処理する速度は2〜4トークン/秒しか出ない。一方 A3B なら40トークン/秒以上出る。
>>45
この手のモデルはCPUでもそこそこ現実的な速度で動かせる。
この手のモデルはCPUでもそこそこ現実的な速度で動かせる。
3090一枚で Unsloth の Q4_K_M、llama.cpp で「自転車に乗ったペリカンのSVGを生成して」を一発試した結果がこれ: https://www.reddit.com/r/LocalLLaMA/comments/1voa3ch/comment…
とんでもない一週間だ。GLM 5.3 が出たと思ったら、今度は Qwen から小型のローカルモデル Qwen3.8-27B が来た。Pi Agent で試してみたが、かなり有望に見える。
M4 Max 128GB で動かすときの最適解について、何かヒントはないだろうか。前の27B(MLX)はトークン生成がやや遅く、結局 A3B 版を使うことになった。まともな速度が出せるなら、こちらを使いたいのだが。
>>11
数日中に出るであろう MTP 版を待つのがいい。私は128GBの Strix Halo機を使っていて、3.6-27B の8ビット版で9トークン/秒程度(お世辞にも良くない)だった。MTP なら18トークン/秒近くまで上がる(どうにか実用になる水準)。
数日中に出るであろう MTP 版を待つのがいい。私は128GBの Strix Halo機を使っていて、3.6-27B の8ビット版で9トークン/秒程度(お世辞にも良くない)だった。MTP なら18トークン/秒近くまで上がる(どうにか実用になる水準)。
>>11
MTPLX を試して、コンテキストサイズを絞るといい。
MTPLX を試して、コンテキストサイズを絞るといい。
このベンチマークが実態を反映しているなら、我々は今、ハイエンドの個人用PCで動かせるローカルモデルを手にしたことになる。しかも半年前の最上位モデルである Claude Opus 4.6 Max と打ち合えるものを。もし本当ならとんでもない話だ。今ダウンロードしている。
27Bの密モデルで Opus 4.6 級。自宅にOpusがある状態だ。新しい10B前後の版も出てほしい。
>>13
私は 3.8-122B の MoE 版に期待している。
私は 3.8-122B の MoE 版に期待している。
>>13
9Bや10Bクラスの言語モデルの使い道を教えてもらえないか? たとえば気の利いた bash コマンドを出させるために LoRA を学習させる、くらいしか思いつかないのだが。
9Bや10Bクラスの言語モデルの使い道を教えてもらえないか? たとえば気の利いた bash コマンドを出させるために LoRA を学習させる、くらいしか思いつかないのだが。
アーキテクチャの話をしよう。見たところ gated attention と delta net を引き続き使っていて、これは K3 でも採用・改変されたものだ。ただ、残差ストリームに改良が入っていないのは意外だった(DeepSeek は manifold hyper-connections を、Kimi は attention residuals を使っている)。性能向上は全部トレーニング由来ということなんだろうか?
>>14
GLM 5.3 のときもそうだったが、事後学習にはまだ相当絞り出せる余地が残っているようだ。
GLM 5.3 のときもそうだったが、事後学習にはまだ相当絞り出せる余地が残っているようだ。
私は Qwen を、DeepSeek V4 Flash に処理させるための視覚モデルとして使っている。Qwen 側は古い RTX A6000(Ampere)で動かしている。A6000向けの INT4/AWQ 量子化について何か情報を持っている人はいないだろうか。
>>15
最近まさに似たことをやろうと考えていた。要するに Qwen に見えたものを説明させて、それを Flash に渡しているということ? Flash に LoRA なり視覚ヘッダなりを足すことも検討したが、うまく仕上げるには時間がかかりそうだった。DSv4 Flash がマルチモーダルだったら、しばらくモデル探しは終わりにできるのだが。
最近まさに似たことをやろうと考えていた。要するに Qwen に見えたものを説明させて、それを Flash に渡しているということ? Flash に LoRA なり視覚ヘッダなりを足すことも検討したが、うまく仕上げるには時間がかかりそうだった。DSv4 Flash がマルチモーダルだったら、しばらくモデル探しは終わりにできるのだが。
これは大きな進歩だ。しかも実際にノートPCで動かせるものとして。
Qwen/Alibaba はなぜ自分でモデルをホストしないんだろう。彼らのコーディングプランで試すのを楽しみにしていたのだが。Google も Gemma モデルについて同じ姿勢だ。
>>17
Gemma モデルは Google の「Vertex AI」で使えたはずだ。
Gemma モデルは Google の「Vertex AI」で使えたはずだ。
新しい DSv4 Flash より安いトークン単価でこれを提供できる事業者が出てくるだろうか。あちらは安いうえに賢いからな……。完全にローカルで使う場合は、もちろん話が別だが。
驚いた。速度も向上している。RTX 5090で200トークン/秒だ!
https://x.com/sgl_project/status/2088281320422322413
https://x.com/sgl_project/status/2088281320422322413
自分専用のテストをいろいろなモデルで試している人がいたら、この新しいモデルが他と比べてどれくらい良いのか悪いのか、ここで教えてもらえないだろうか。私はそういう利用者の実地テストしか信用していない。
>>23
YouTube に、神がかったハードウェアではなく市販の機材でLLMを動かして一連のテストをする、地に足のついた人がいる。近いうちにこれもテストするだろう。
https://www.youtube.com/@lukesdevlab
求めているものかどうかは分からないし、いつものことだが体験は人によって違うだろう。
YouTube に、神がかったハードウェアではなく市販の機材でLLMを動かして一連のテストをする、地に足のついた人がいる。近いうちにこれもテストするだろう。
https://www.youtube.com/@lukesdevlab
求めているものかどうかは分からないし、いつものことだが体験は人によって違うだろう。
4090で q4km がおよそ48トークン/秒。llama.cpp のパラメータは –flash-attn on –parallel 1 –load-mode mmap。
>>26
投機的デコードを使えば軽く100トークン/秒を超えるはずだ。うちの3090二枚構成では、qwen 3.5 27b が https://github.com/noonghunna/club-3090 の設定で110トークン/秒あたり出ていた。5090一枚なら200トークン/秒、Opus の4倍速ということになる。
https://x.com/radixark/status/2088285681131110446
開発者に5090を2枚積んだ箱が配られて「これを使い倒せ」と言われる日も近い。
投機的デコードを使えば軽く100トークン/秒を超えるはずだ。うちの3090二枚構成では、qwen 3.5 27b が https://github.com/noonghunna/club-3090 の設定で110トークン/秒あたり出ていた。5090一枚なら200トークン/秒、Opus の4倍速ということになる。
https://x.com/radixark/status/2088285681131110446
開発者に5090を2枚積んだ箱が配られて「これを使い倒せ」と言われる日も近い。
もう一つ良い点。Qwen 3.8 27b はマルチモーダルだ。
>>32
視覚推論が強いらしく、これはうれしい。ただ音声はまだネイティブ対応していない。`gemma-4-12b-qat` のような、本当の意味でのマルチモーダル(テキスト・画像・動画・音声)を目指す姿勢を、もっと多くの企業に受け継いでほしい。
視覚推論が強いらしく、これはうれしい。ただ音声はまだネイティブ対応していない。`gemma-4-12b-qat` のような、本当の意味でのマルチモーダル(テキスト・画像・動画・音声)を目指す姿勢を、もっと多くの企業に受け継いでほしい。
llama.cpp がこのモデルの新要素に追いつくまで待つのを忘れずに。判断は2週間ほど使ってからにしたほうがいい。
>>33
「良い」知らせとして、アーキテクチャ上の新要素は何もないようだ。Qwen 3.5 や 3.6 と同じなので、llama.cpp から見れば違いはない。
「良い」知らせとして、アーキテクチャ上の新要素は何もないようだ。Qwen 3.5 や 3.6 と同じなので、llama.cpp から見れば違いはない。
>>5
> アーキテクチャ設計には GLM-5.3(旧 Deepseek v4 pro 0813)で落ち着いた
おい、GLM-5.3 は*今日*リリースされたばかりだぞ。この文脈で「落ち着いた」という言い方はおかしい。
> アーキテクチャ設計には GLM-5.3(旧 Deepseek v4 pro 0813)で落ち着いた
おい、GLM-5.3 は*今日*リリースされたばかりだぞ。この文脈で「落ち着いた」という言い方はおかしい。
>>47
だから「旧 deepseek v4 pro」と書いている。今朝試してみて特に不満はない。そもそも glm 5.2 も気に入っていた。
だから「旧 deepseek v4 pro」と書いている。今朝試してみて特に不満はない。そもそも glm 5.2 も気に入っていた。
>>38
> ……しかし違う。実際の運用ではOpusには勝てない
同意するが、それならそれを明確に示す意味のあるベンチマークが必要だ。そうでなければ、本来は定量的に紙に書き出せるはずのことを、身振り手振りで語っているだけになる。
> ……しかし違う。実際の運用ではOpusには勝てない
同意するが、それならそれを明確に示す意味のあるベンチマークが必要だ。そうでなければ、本来は定量的に紙に書き出せるはずのことを、身振り手振りで語っているだけになる。
>>68
企業で言語モデルを使っているなら、信頼できる評価セットを自前で用意して、新しいモデルの検証に使うのが非常に良い。ときどき本番データで較正もする。うちにも独自のものがあり、品質とコストについて私が信用している数字は、この仕組みから出てきたものだけだ。
企業で言語モデルを使っているなら、信頼できる評価セットを自前で用意して、新しいモデルの検証に使うのが非常に良い。ときどき本番データで較正もする。うちにも独自のものがあり、品質とコストについて私が信用している数字は、この仕組みから出てきたものだけだ。
>>68
かつて賢人が言った。「数えられるものすべてが重要なわけではなく、重要なものすべてが数えられるわけでもない」
かつて賢人が言った。「数えられるものすべてが重要なわけではなく、重要なものすべてが数えられるわけでもない」
>>68
結局のところ、意味を持つ唯一のベンチマークは自分自身のベンチマークだ。
結局のところ、意味を持つ唯一のベンチマークは自分自身のベンチマークだ。
※本記事は5ch(Hacker News)スレッド「Qwen3.8-27B」より抜粋・要約して構成しています。






まだコメントはありません。