Databricks Certified Generative AI Engineer Associate 教科書
第6章 ガバナンス(Governance, 8%)
🎯 この節の学習目標
Hugging Face などで重み(weights)が公開されているモデルは「オープンウェイトモデル」と呼ばれますが、ダウンロードできることと自由に使えることは別問題です。すべてのモデルには何らかのライセンス(利用許諾)が付いており、その内容はモデルごとに大きく異なります。大きくは次の2系統に分かれます。
| 系統 | 代表的なライセンス | 特徴 |
|---|---|---|
| 完全なオープンソース型 | Apache 2.0 / MIT など、OSSとして広く認められたライセンス | 商用利用・改変・再配布が基本的に自由。制約が少なく、商用製品への組み込みで最も扱いやすい |
| 独自コミュニティライセンス型 | Meta の Llama 系に代表される、モデル提供者が独自に定めるライセンス | 商用利用は認めつつも、利用規約(Acceptable Use Policy)の順守や、非常に大規模な事業者に対する追加条件など、独自の条件が付く。条文を読んで自社が条件に該当しないか確認する必要がある |
つまり「Llama はオープンだから何も気にせず商用製品に組み込める」と即断するのは危険で、ライセンス条文の確認がエンジニアリング工程の一部だということです。Databricks の Foundation Model APIs で提供されるモデルであっても、各モデルのライセンス自体はモデル提供者のものが適用されます。
モデルを採用する前にチェックすべき代表的な項目を整理します。試験でも「商用製品に組み込む前に確認すべきことは?」という形で問われる観点です。
| 確認項目 | 確認する内容 | 見落とした場合のリスク |
|---|---|---|
| 商用利用の可否 | 商用製品・有償サービスへの組み込みが許可されているか。研究・非商用限定のライセンスではないか | ライセンス違反によるサービス停止・法的リスク |
| 派生モデルの扱い | ファインチューニングしたモデル(派生モデル)の利用・再配布の条件。派生モデルに元のライセンスの継承や名称に関する条件が課されることがある | ファインチューニング済みモデルを配布・提供できない、条件違反になる |
| 出力の利用条件 | モデルの生成物(出力)の利用に条件がないか。例えば出力を他のモデルの学習に使うことを制限するライセンスがある | 出力データを使った学習パイプラインが規約違反になる |
| クレジット表記義務 | 製品やドキュメントに「Built with ...」等の表記やライセンス文の同梱が求められるか | 表記漏れによる形式的なライセンス違反 |
| 利用規約(AUP) | 禁止用途(違法行為、特定の高リスク用途など)に自社ユースケースが該当しないか | 用途自体が許諾範囲外になる |
📝 試験のポイント
「オープンウェイトモデルを商用製品に組み込む前に生成AIエンジニアが確認すべきことは?」と問われたら、答えの軸はモデルライセンスの商用利用条件です。「重みが公開されている=無条件で商用利用可」とする選択肢は誤りです。また、Apache 2.0 / MIT は制約の少ない完全なOSSライセンス、Llama 系は条件付きの独自コミュニティライセンス、という対比も押さえておきましょう。
OpenAI や Anthropic などのプロプライエタリモデルをAPIで利用する場合、確認すべきなのはライセンスではなくサービスの利用規約・データ取り扱いポリシーです。特に企業利用では次の観点が重要です。
💼 例:モデル選定時のライセンス比較
ある企業が有償のSaaS製品にチャット機能を組み込むため、次の3案を比較しているとします。
どれが正解というものではなく、品質・コスト・運用に加えて「ライセンス・規約」を選定基準に含めることがポイントです。
ガバナンスの観点では、モデルだけでなくデータ側の権利・規制の確認も必要です。ファインチューニングの学習データやRAGで索引化する文書にも、それぞれ権利者と利用条件があります。
ライセンス確認を個々の開発者の注意力に任せると、いつか漏れが生じます。組織としては次のような統制の仕組みを整えます。
✅ この節のまとめ
問1. ある企業が、Hugging Face で重みが公開されているLLMを自社の有償SaaS製品に組み込もうとしている。生成AIエンジニアがモデル採用の前に必ず確認すべきことはどれか。
正解:B
重みが入手できることと商用利用が許可されていることは別問題であり、採用前にライセンスの商用条件を確認するのがガバナンスの基本です。Aは「オープンウェイト=無条件で自由」という典型的な誤解です。CとDは技術的な検討事項としては意味がありますが、「商用製品への組み込み前に必ず確認すべきこと」という文脈ではライセンスが優先されます。
問2. Apache 2.0 ライセンスのモデルと、Meta Llama のコミュニティライセンスのモデルの違いに関する説明として、最も適切なのはどれか。
正解:B
Apache 2.0 / MIT は制約の少ない標準的なOSSライセンスで、商用利用・改変・再配布が基本的に自由です。一方 Llama 系は、商用利用を広く認めながらも、利用規約や大規模事業者向けの条件など独自の条件が付くコミュニティライセンスです。Aは両者とも商用利用可能なので誤り、Cは制約の大小関係が逆、Dは事実に反します(Apache 2.0 は改変=ファインチューニングも自由です)。
問3. 規制の厳しい業界の企業が、プロプライエタリLLMのAPIを業務データで利用することを検討している。利用規約で確認すべき項目の組み合わせとして最も適切なのはどれか。
正解:A
外部APIに業務データを送る際のガバナンス上の確認点は、データの学習利用の有無・保持期間・処理リージョンです。特に規制業界では国外リージョンでの処理が制約になることがあります。Bはモデル内部のアーキテクチャの話で規約とは無関係、Cは実装上の詳細であり法的・ガバナンス上の確認事項ではありません。Dはベンダー評価の一要素にはなり得ますが、利用規約の確認項目ではありません。
問4. 大企業で複数チームが生成AIアプリを開発しており、各チームが独自の判断で様々な外部モデルを使い始めてライセンス・規約の確認漏れが心配されている。組織的な統制として最も適切なアプローチはどれか。
正解:B
統制は「ルールの周知」だけでなく「仕組みによる強制」で実現するのが確実です。承認済みモデルのカタログ化と承認プロセスに加え、Unity AI Gateway でアクセス経路を一元化すれば、未承認モデルの利用を技術的に防げます。Aは漏れが必ず発生します。Cはビジネス価値を放棄する過剰反応です。Dは「1つに絞る」こと自体は統制になり得ますが、ライセンスを確認しない時点でガバナンスとして成立していません。