中国のAI開発、次のボトルネックは「中国語の訓練データ不足」 チップ規制の先にある壁
中国のAI開発が訓練データ不足に直面しているという報道が、5chの科学ニュース+で議論になっていたので紹介する。
高度なAIモデルの性能を伸ばすには大量の質の高い訓練データが必要です。
中国のAI開発を阻む問題としてはアメリカによる先端AIチップの輸出規制が注目されてきましたが、中国のAI専門家は中国語の訓練データ不足が次の大きなボトルネックになりうると警告しています。
出典: South China Morning Post / 元記事はこちら
データ量そのものより質と検閲の影響を指摘する声が目立った。
難易度高い言語の国は大変だな
まあ日本語もその次の次くらいにそうなんだけど
まあ日本語もその次の次くらいにそうなんだけど
>>2
言語的な構造でAIが学習するのは日本語のほうが難しい
日本語は語順も決まってないし、主語の省略とかも多いし、AIにとっては結構な難敵
言語的な構造でAIが学習するのは日本語のほうが難しい
日本語は語順も決まってないし、主語の省略とかも多いし、AIにとっては結構な難敵
英語丸パクリしてるからか
>>3
なるほど
自前でデータ用意している日本のAIは日本語の方が強いしな
プライバシーのない中国なのに、データ不足はわけわからん
なるほど
自前でデータ用意している日本のAIは日本語の方が強いしな
プライバシーのない中国なのに、データ不足はわけわからん
>>28
言論統制されてるからじゃね?
日本は好きかって書いてるし
書くこと知らせること大好き人種だし。
言論統制されてるからじゃね?
日本は好きかって書いてるし
書くこと知らせること大好き人種だし。
中国は広いし方言も色々だろうからな
広東語ベースのAIと福建語ベースのAIだと得意不得意もあるのかもしれん
広東語ベースのAIと福建語ベースのAIだと得意不得意もあるのかもしれん
日本語が表意文字表音文字の言語圏間のグルー言語としてLLMのなかでつかわれたり
「マンガ」がマルチモーダルAIの学習に有用だったり思想。
「マンガ」がマルチモーダルAIの学習に有用だったり思想。
日本の権威の文献て「我が国の状況は」とか「私たちはこうしなければならない」とか聞き手や読者を日本前提で話しし書くよね
その文章は日本前提とは書いてないのにね
これがハイコンテキストそのもの
その文章は日本前提とは書いてないのにね
これがハイコンテキストそのもの
しかも
聞き手や読者を話し手と同じ立場においてしまう
議論が起きない
話し手が権威であるほど逆らえない
日本の教育が小学校からこれで育てられる
聞き手や読者を話し手と同じ立場においてしまう
議論が起きない
話し手が権威であるほど逆らえない
日本の教育が小学校からこれで育てられる
議論を対論をいうと「ケンカをふっかける」と表現するカルチャー
大学教育も教授についたら徒弟制度
iPS細胞の山中教授が専門を変えるのを迷っていた時に利根川教授の講演会で質問してかえてもいいものでしようか?に変えていいんだよ言われてiPSにつながる専門に変えたというエピソード
それほど大変な徒弟制度
封建時代の日本
大学教育も教授についたら徒弟制度
iPS細胞の山中教授が専門を変えるのを迷っていた時に利根川教授の講演会で質問してかえてもいいものでしようか?に変えていいんだよ言われてiPSにつながる専門に変えたというエピソード
それほど大変な徒弟制度
封建時代の日本
中共の場合は言語の壁よりも隠したいデータをどれだけ隠したままにできるのかが問題なんじゃないか。
中国語に限らず、言語データが足りないって話は昔からあるだろ。
インターネット10個分くらい必要だってさ。
インターネット10個分くらい必要だってさ。
言い換えれば、アメリカから全情報を盗んだと語っている
そもそもAIには日本語と中国語の区別できない
追加プロンプト無しの時はわざとプロンプトにひらがな入れてやらないと高確率で中国語回答生成される
追加プロンプト無しの時はわざとプロンプトにひらがな入れてやらないと高確率で中国語回答生成される
>>22
こいつ何使ってるのかね?
アホちゃう?
こいつ何使ってるのかね?
アホちゃう?
中華生成AiのLLMは自前で使う分には天安門も何万人も死んで世界から非難されていますと言ってたよ
オレがやったのはディープシーク
オレがやったのはディープシーク
GLM使ってるが天安門なんて聞いたことないな
そんなこと今でも言ってるやつはど素人
そんなこと今でも言ってるやつはど素人
もっと少ない学習データでも賢くなる次世代Transformerは出来ないの?
AIが日本文化大好きなのなんでなんだろうな?
>>30
逆に、うっかり触れると気不味い地雷人間って居るだろ
逆に、うっかり触れると気不味い地雷人間って居るだろ
>>30
データとして無難だから
変なバイアスが掛かっていないニュートラルな情報が多いから
と最近どこかのニュースで見たが出処は忘れた
データとして無難だから
変なバイアスが掛かっていないニュートラルな情報が多いから
と最近どこかのニュースで見たが出処は忘れた
>>30
単純にソフトパワーがあるから英語でも日本文化の記述が多い
そして今の世界状況を見ると欧米価値観の矛盾・摩擦→持続不可能性が明らかになり社会がかなり破綻している
一方で日本は島国根性=狭い世界で生きるための知恵があるから
世界が狭くなった今その知恵が必要となる事もある
たとえば出る杭を叩くってのも一見糞思想に見えるが
実は狭い島国で資源が限られている中 誰かひとりが富を一人締めすると
他皆の取り分が減って 他が枯れて労働力が確保できなくなって 持続不可能になる
(皆が中間層なのが狭い世界では実は長期的に生存有利だった)
これが現代社会でも起きている
しかし現実はもっと複雑でアフリカなんかに表面的な支援をした結果土地のキャパを超えてしまい難民化したのをEU中間層が引き受けるみたいな持続不可能性もあるが
これも従来の欧米価値観では処理しづらい問題(大陸国は拡大思想の限界に今直面している)で 延々と悪化している現状がある
単純にソフトパワーがあるから英語でも日本文化の記述が多い
そして今の世界状況を見ると欧米価値観の矛盾・摩擦→持続不可能性が明らかになり社会がかなり破綻している
一方で日本は島国根性=狭い世界で生きるための知恵があるから
世界が狭くなった今その知恵が必要となる事もある
たとえば出る杭を叩くってのも一見糞思想に見えるが
実は狭い島国で資源が限られている中 誰かひとりが富を一人締めすると
他皆の取り分が減って 他が枯れて労働力が確保できなくなって 持続不可能になる
(皆が中間層なのが狭い世界では実は長期的に生存有利だった)
これが現代社会でも起きている
しかし現実はもっと複雑でアフリカなんかに表面的な支援をした結果土地のキャパを超えてしまい難民化したのをEU中間層が引き受けるみたいな持続不可能性もあるが
これも従来の欧米価値観では処理しづらい問題(大陸国は拡大思想の限界に今直面している)で 延々と悪化している現状がある
人口や技術水準の割に、ネット上の高品質サンプルが少ないのは納得
でも日本語も、表面化してないだけな気はする
でも日本語も、表面化してないだけな気はする
アンソロとか自分で古い本を大量に買ってスキャンしてるよね
中国はそれができないのかな?
あ、文革とかで焚書したからまともな知識の本は残ってないか。。。
共産党が出てくる以前の記述は使えないしな。政治的に。
いろいろ制約あるな中国製は。
ちゃんとした歴史を保存していないから。
中国はそれができないのかな?
あ、文革とかで焚書したからまともな知識の本は残ってないか。。。
共産党が出てくる以前の記述は使えないしな。政治的に。
いろいろ制約あるな中国製は。
ちゃんとした歴史を保存していないから。
昔から焚書を繰り返してるやろうしな…文化大革命もあったし…
>>37
他人のことは悪く言えるのに自分のことはわからない
日本は改元するのは歴史を忘れさせるためだよ
明治からは簡単には変えられないから
安倍政権はひと月過ぎたら廃棄をオーソライズした
他人のことは悪く言えるのに自分のことはわからない
日本は改元するのは歴史を忘れさせるためだよ
明治からは簡単には変えられないから
安倍政権はひと月過ぎたら廃棄をオーソライズした
アメリカからの盗んだものだからね
>>45
アメリカのものは中国人の技術でその半分以上は作られているものだからね
アメリカのものは中国人の技術でその半分以上は作られているものだからね
1>中国語の訓練データ不足
なぜだか、「外国語の訓練データ」は、
それこそイッパイ持っているんダロ。
それを「AI 向けの中国語」に変換する、
専用の AI を育成すればイイんだろうに。
なぜだか、「外国語の訓練データ」は、
それこそイッパイ持っているんダロ。
それを「AI 向けの中国語」に変換する、
専用の AI を育成すればイイんだろうに。
>>59
その中に中共に不都合な情報があったら困るんよ
壁の外発信の中国語データは限られてるから中国語を訓練データにするのは正しい
その中に中共に不都合な情報があったら困るんよ
壁の外発信の中国語データは限られてるから中国語を訓練データにするのは正しい
※本記事は5ch(科学ニュース+)スレッド「【AI】中国のAI開発は「中国語の訓練データ不足」という新たなボトルネックに直面している」より抜粋・要約して構成しています。






まだコメントはありません。