日本語に強いLLMの現状とライセンス比較、サラトナのモデル開発

クラウドAIの多くは日本語が得意です。ChatGPT、Claude、Geminiなどの日本語っておかしいって思うことは少ないですよね。一方で、DeepSeek、Qwen、KIMIなどの中国製LLMを使っていて「あれ?」と感じる場面も少なくありません。私たちが利用できるローカルLLMの多くは中国製であり、優秀なエンジニアが開発に携わっているためその出来栄え自体は非常に優れています。

目次

中国製LLMと日本製LLMの動向

その点、日本製のLLMは開発が相当遅れており、多くの場合は中国製LLMを日本語用にカスタマイズしているのが現状です。最近では日本語に特化したモデルも徐々に登場していますが、米国のAI水準と比較すると依然として差があり、米中のトップレベルにすぐに到達するのは難しいと考えられます。

AIとLLMの包含関係と違い

AI(人工知能)とLLM(大規模言語モデル)の違いは、一言で言うと「全体(概念の広さ)」と「その中にある特定の技術(専門分野)」の関係です。LLMはAIという大きなグループの中に含まれる、言語処理に特化した技術の一つです。

一目でわかる包含関係

[ AI(人工知能)] ← 最も広い概念(車全般)
└── [ 機械学習(ML)] └── [ 深層学習(DL)] └── [ LLM(大規模言語モデル)] ← 言語特化型のAI(例:電気自動車の自動運転システム)

2つの違いを比較

項目AI(人工知能)LLM(大規模言語モデル)
定義人間の知的な振る舞いを模倣・再現する技術全般膨大なテキストデータを学習し、言葉を理解・生成するAI技術
扱う対象テキスト、画像、音声、動画、数値、ロボットの制御など何でも主に言語(テキスト、プログラムコードなど)
主な用途自動運転、顔認証、ゲーム(将棋・囲碁)、需要予測など文章作成・要約、翻訳、チャットボット、コード生成など
代表例自動掃除機、画像生成AI、ルンバの障害物回避などGPT-4、Gemini、Claude、Llamaなど

主なポイント

1. AI(Artificial Intelligence)とは?

コンピューターに「人間のような知的な判断や推論」をさせる技術の総称(大きな傘)です。

  • ルール通りに動くシンプルなプログラムから、自分で学習する複雑なシステムまで幅広く含まれます。
  • 画像を見る、声を聞く、車を運転する、チェスを指すなど、目的は多岐にわたります。

2. LLM(Large Language Model)とは?

AIの領域の中でも、特に「人間の言葉(自然言語)」を扱うことに特化した最新の技術です。

  • インターネット上の膨大な文章データを学習(大規模)しています。
  • 文脈を理解し、人間と会話しているような自然な文章を生成したり、複雑な質問に答えることができます。

例えで理解するなら

  • AI が「スポーツ」という広いカテゴリーだとすれば、
  • LLM はその中にある「サッカーのストライカー」という特定の役割・専門分野のようなものです。

つまり、「すべてのLLMはAIだが、すべてのAIがLLMというわけではない」ということになります。

Apache License 2.0とMITライセンスの比較

Apache License 2.0はMITライセンスと同じく許容的ライセンスですが、特許権の明示的付与やNOTICEファイルの扱いなど追加義務がある点で異なります。

基本的な共通点

  • 許容的ライセンス(Permissive License)であり、コピーレフトはありません。改変、商用利用、非公開配布が自由に行えます note(ノート)
  • 外部配布時には著作権表示とライセンス文の同梱が必要ですが、コード公開義務はありません note(ノート)
  • MITもApache 2.0も、派生物を独自ライセンスで配布可能です crexgroup.com

Apache License 2.0の特徴

  • 特許権の明示的付与:貢献者が持つ特許を、該当OSSに関して無料で使用できる権利が付与されます。商用利用時の特許リスクを軽減できる点が大きなメリットです Zenn
  • NOTICEファイルの扱い:配布物にNOTICEファイルが含まれる場合、その内容を保持する義務があります。軽視すると法的リスクが生じる可能性があります Qiita
  • 条項がやや複雑:MITに比べて条文が多く、特許やNOTICEに関する条件を遵守する必要があります note(ノート)

MITライセンスの特徴

  • 非常にシンプルで制約が少ないライセンスです。著作権表示の明示のみが必要で、特許権の明示的付与は規定されていません note(ノート)
  • 個人・商用問わず利用しやすく、ReactやVue.js、jQueryなど多くのOSSで採用されています。

Qwenの特性とバージョン選択

Qwenは中国のAlibabaグループが開発しており、多くの種類がApache License 2.0で公開されているため、利用や配布において非常に便利です。ただし、バージョンによって公開制限がある場合があり注意が必要です。また、新しいバージョンが必ずしも最適とは限らず、ユースケースやモデルのバージョンによって速度やアウトプットの質が大きく変わります。

サラトナにおける日本語特化モデルの開発と評価

サラトナではQwenを活用して日本語に強いモデルを構築し、量子化を行っています。品質の測定方法は以下の通りです。従来は量子化後にそのまま開示していましたが、モデル更新に伴う手戻りを防ぐため、基本となる評価基準(仮説閾値:uncalibrated)を策定しました。

ゲート何を見るか合格の目安(仮説)
G1能力別の中央値・低点率中央値 ≥ 3.0 かつ 点≤1 の割合 ≤ 5%
G2required 全体の平均点平均 ≥ 3.2(0–3 スケール)
G3重大ミス(捏造・致命欠陥)critical = 0 件(OR:どちらかの評価者が critical ならカウント)

サラトナではRunPodを利用してLLMの作成を行っています。費用と時間はかかりますが、多くの方にご活用いただけることを目指しています。

快斗(ASHBYS,SARATNA)|note

noteでは日記形式の投稿を、また詳細なダウンロードファイルについてはpCloudの一部を公開していく予定です。最新のLLMは現在調整中であり、今週中の完成を目指しています。

よかったらシェアしてね!

コメント

コメントする