Qwen3.8-27Bが公開 海外「意味を持つ唯一のベンチマークは自分のものだけ」

Alibaba が小型のオープンモデル「Qwen3.8-27B」を公開した。海外の技術系掲示板Hacker Newsでは、27Bという規模で上位モデルと張り合うベンチマーク結果と、手元のGPUでどれだけ速度が出るかに関心が集まった。

Qwen3.8-27B(Qwenチームによる公開告知)

出典: twitter.com / 元記事はこちら

3 海外の名無しさん 2026-08-14 15:11
DeepSWE で Opus 4.7 Max(Claude Code 使用)を上回っている(42.2 対 40)。Qwen の27Bモデルは相変わらず力がある。
Unsloth の GGUF 量子化版が上がっている: https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
39 海外の名無しさん 2026-08-14 15:14
>>3
Unsloth のモデルを使うのは、公式の https://huggingface.co/Qwen/Qwen3.8-27B-FP8 と比べて何か利点があるんだろうか?
40 海外の名無しさん 2026-08-14 15:23
>>3
量子化版それぞれを、元のモデルと同じテストでベンチマークしてほしい。そうすれば性能を比較できるのに。
41 海外の名無しさん 2026-08-14 15:13
>>3
サイズ差が圧倒的なことを考えると、これは驚異的だ。もっとも、小さいQwenモデルが階級以上の力を出すのは知られている話ではある。
4 海外の名無しさん 2026-08-14 15:12
新しい 35B A3B か、それに類する MoE モデルが出てほしくてたまらない。80B A3B だった Qwen 3 Coder Next も惜しかった。VRAM はあるが TDP や演算性能が足りない、という状況では 100B 未満の非密モデルがちょうどいい落としどころになる場面がかなりある。中間として A5B でも A8B でも、なんなら A10B でも喜んで使う。
ログインせずに画像を見るための代替リンク: https://xcancel.com/Alibaba_Qwen/status/2088280182356611304
45 海外の名無しさん 2026-08-14 15:40
>>4
> 中間として A5B でも A8B でも
みんなアクティブパラメータ数にこだわっているのは何なんだ? 重みをいじったりしているのか?
78 海外の名無しさん 2026-08-14 16:28
>>45
総パラメータ数は必要なVRAM量を決め、アクティブパラメータ数は動作速度を決める。うちの10年前のGPUは量子化した35Bや27Bを読み込めるが、1トークンあたり27Bパラメータを処理する速度は2〜4トークン/秒しか出ない。一方 A3B なら40トークン/秒以上出る。
79 海外の名無しさん 2026-08-14 15:44
>>45
この手のモデルはCPUでもそこそこ現実的な速度で動かせる。
8 海外の名無しさん 2026-08-14 15:48
3090一枚で Unsloth の Q4_K_M、llama.cpp で「自転車に乗ったペリカンのSVGを生成して」を一発試した結果がこれ: https://www.reddit.com/r/LocalLLaMA/comments/1voa3ch/comment…
9 海外の名無しさん 2026-08-14 16:33
とんでもない一週間だ。GLM 5.3 が出たと思ったら、今度は Qwen から小型のローカルモデル Qwen3.8-27B が来た。Pi Agent で試してみたが、かなり有望に見える。
11 海外の名無しさん 2026-08-14 15:16
M4 Max 128GB で動かすときの最適解について、何かヒントはないだろうか。前の27B(MLX)はトークン生成がやや遅く、結局 A3B 版を使うことになった。まともな速度が出せるなら、こちらを使いたいのだが。
55 海外の名無しさん 2026-08-14 16:06
>>11
数日中に出るであろう MTP 版を待つのがいい。私は128GBの Strix Halo機を使っていて、3.6-27B の8ビット版で9トークン/秒程度(お世辞にも良くない)だった。MTP なら18トークン/秒近くまで上がる(どうにか実用になる水準)。
57 海外の名無しさん 2026-08-14 15:24
>>11
MTPLX を試して、コンテキストサイズを絞るといい。
12 海外の名無しさん 2026-08-14 15:16
このベンチマークが実態を反映しているなら、我々は今、ハイエンドの個人用PCで動かせるローカルモデルを手にしたことになる。しかも半年前の最上位モデルである Claude Opus 4.6 Max と打ち合えるものを。もし本当ならとんでもない話だ。今ダウンロードしている。
13 海外の名無しさん 2026-08-14 15:11
27Bの密モデルで Opus 4.6 級。自宅にOpusがある状態だ。新しい10B前後の版も出てほしい。
58 海外の名無しさん 2026-08-14 16:08
>>13
私は 3.8-122B の MoE 版に期待している。
59 海外の名無しさん 2026-08-14 15:33
>>13
9Bや10Bクラスの言語モデルの使い道を教えてもらえないか? たとえば気の利いた bash コマンドを出させるために LoRA を学習させる、くらいしか思いつかないのだが。
14 海外の名無しさん 2026-08-14 16:10
アーキテクチャの話をしよう。見たところ gated attention と delta net を引き続き使っていて、これは K3 でも採用・改変されたものだ。ただ、残差ストリームに改良が入っていないのは意外だった(DeepSeek は manifold hyper-connections を、Kimi は attention residuals を使っている)。性能向上は全部トレーニング由来ということなんだろうか?
60 海外の名無しさん 2026-08-14 16:19
>>14
GLM 5.3 のときもそうだったが、事後学習にはまだ相当絞り出せる余地が残っているようだ。
15 海外の名無しさん 2026-08-14 16:16
私は Qwen を、DeepSeek V4 Flash に処理させるための視覚モデルとして使っている。Qwen 側は古い RTX A6000(Ampere)で動かしている。A6000向けの INT4/AWQ 量子化について何か情報を持っている人はいないだろうか。
61 海外の名無しさん 2026-08-14 16:26
>>15
最近まさに似たことをやろうと考えていた。要するに Qwen に見えたものを説明させて、それを Flash に渡しているということ? Flash に LoRA なり視覚ヘッダなりを足すことも検討したが、うまく仕上げるには時間がかかりそうだった。DSv4 Flash がマルチモーダルだったら、しばらくモデル探しは終わりにできるのだが。
16 海外の名無しさん 2026-08-14 15:08
これは大きな進歩だ。しかも実際にノートPCで動かせるものとして。
17 海外の名無しさん 2026-08-14 16:15
Qwen/Alibaba はなぜ自分でモデルをホストしないんだろう。彼らのコーディングプランで試すのを楽しみにしていたのだが。Google も Gemma モデルについて同じ姿勢だ。
62 海外の名無しさん 2026-08-14 16:25
>>17
Gemma モデルは Google の「Vertex AI」で使えたはずだ。
19 海外の名無しさん 2026-08-14 15:41
新しい DSv4 Flash より安いトークン単価でこれを提供できる事業者が出てくるだろうか。あちらは安いうえに賢いからな……。完全にローカルで使う場合は、もちろん話が別だが。
20 海外の名無しさん 2026-08-14 16:20
驚いた。速度も向上している。RTX 5090で200トークン/秒だ!
https://x.com/sgl_project/status/2088281320422322413
23 海外の名無しさん 2026-08-14 15:35
自分専用のテストをいろいろなモデルで試している人がいたら、この新しいモデルが他と比べてどれくらい良いのか悪いのか、ここで教えてもらえないだろうか。私はそういう利用者の実地テストしか信用していない。
63 海外の名無しさん 2026-08-14 15:39
>>23
YouTube に、神がかったハードウェアではなく市販の機材でLLMを動かして一連のテストをする、地に足のついた人がいる。近いうちにこれもテストするだろう。
https://www.youtube.com/@lukesdevlab
求めているものかどうかは分からないし、いつものことだが体験は人によって違うだろう。
26 海外の名無しさん 2026-08-14 15:12
4090で q4km がおよそ48トークン/秒。llama.cpp のパラメータは –flash-attn on –parallel 1 –load-mode mmap。
64 海外の名無しさん 2026-08-14 15:14
>>26
投機的デコードを使えば軽く100トークン/秒を超えるはずだ。うちの3090二枚構成では、qwen 3.5 27b が https://github.com/noonghunna/club-3090 の設定で110トークン/秒あたり出ていた。5090一枚なら200トークン/秒、Opus の4倍速ということになる。
https://x.com/radixark/status/2088285681131110446
開発者に5090を2枚積んだ箱が配られて「これを使い倒せ」と言われる日も近い。
32 海外の名無しさん 2026-08-14 15:21
もう一つ良い点。Qwen 3.8 27b はマルチモーダルだ。
65 海外の名無しさん 2026-08-14 15:42
>>32
視覚推論が強いらしく、これはうれしい。ただ音声はまだネイティブ対応していない。`gemma-4-12b-qat` のような、本当の意味でのマルチモーダル(テキスト・画像・動画・音声)を目指す姿勢を、もっと多くの企業に受け継いでほしい。
33 海外の名無しさん 2026-08-14 15:14
llama.cpp がこのモデルの新要素に追いつくまで待つのを忘れずに。判断は2週間ほど使ってからにしたほうがいい。
66 海外の名無しさん 2026-08-14 15:33
>>33
「良い」知らせとして、アーキテクチャ上の新要素は何もないようだ。Qwen 3.5 や 3.6 と同じなので、llama.cpp から見れば違いはない。
47 海外の名無しさん 2026-08-14 15:45
>>5
> アーキテクチャ設計には GLM-5.3(旧 Deepseek v4 pro 0813)で落ち着いた
おい、GLM-5.3 は*今日*リリースされたばかりだぞ。この文脈で「落ち着いた」という言い方はおかしい。
80 海外の名無しさん 2026-08-14 15:46
>>47
だから「旧 deepseek v4 pro」と書いている。今朝試してみて特に不満はない。そもそも glm 5.2 も気に入っていた。
68 海外の名無しさん 2026-08-14 15:32
>>38
> ……しかし違う。実際の運用ではOpusには勝てない
同意するが、それならそれを明確に示す意味のあるベンチマークが必要だ。そうでなければ、本来は定量的に紙に書き出せるはずのことを、身振り手振りで語っているだけになる。
88 海外の名無しさん 2026-08-14 16:01
>>68
企業で言語モデルを使っているなら、信頼できる評価セットを自前で用意して、新しいモデルの検証に使うのが非常に良い。ときどき本番データで較正もする。うちにも独自のものがあり、品質とコストについて私が信用している数字は、この仕組みから出てきたものだけだ。
89 海外の名無しさん 2026-08-14 15:37
>>68
かつて賢人が言った。「数えられるものすべてが重要なわけではなく、重要なものすべてが数えられるわけでもない」
90 海外の名無しさん 2026-08-14 16:19
>>68
結局のところ、意味を持つ唯一のベンチマークは自分自身のベンチマークだ。

※本記事は5ch(Hacker News)スレッド「Qwen3.8-27B」より抜粋・要約して構成しています。

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事