2026/09/26

Domino IQ: Embedding Model の設定

前回は Embedding Model について調査した過程をまとめつつ、採用するモデルは技術情報に倣って bge-m3-Q6_K.gguf としました。今回はダウンロードしたこのモデルを Domino IQ に設定する作業を行います。


LLM の切り替え

Embedding Model の設定の前に LLM を変更します。

というのも、14.5 で DominoIQ がリリースされた時のサポート情報(KB0121957)を改めて確認すると採用しているLLM が「Llama-3-ELYZA-JP-8B-q4_k_m.gguf」から「Qwen3-8B-Q5_K_M.gguf」に変更されていました。理由は『低スペックの環境でも比較的日本語処理性能が高い Qwen3 8B を使用します』と記載されていました。

そこで、この2つのモデルを Chat-GPT 先生に比較してもらいました。

Qwen3-8B Llama-3-ELYZA-JP-8B
ベース Qwen3 Meta Llama 3
パラメータ 8.2B 約8B
特徴 多言語・推論・コード・指示追従を重視 日本語を強化したモデル
日本語 強い かなり強い
Reasoning Thinking / Non-thinkingを切替可能 通常のLLM
ライセンス Apache 2.0 Llama 3系
コンテキスト 32K(YaRNで131Kまで検証) Llama 3系
GGUF Q5_K_M Q4_K_M

どちらも 8B クラスのモデルであるため、必要となる VRAM 容量に大きな違いはないといえます。ただし、ELYZA は Q4_K_M、Qwen3 は Q5_K_M という異なる量子化方式が採用されており、モデル本体のメモリ使用量は Qwen3 のほうがやや大きくなると想定できます。そのため、今回の変更を単純な VRAM 削減を目的としたものと考えるのは適切ではなさそうです。

Qwen3 は日本語処理性能に加えて、多言語対応や推論能力、指示への追従性などを重視したモデルです。今回は、Embedding モデルによる文書検索と LLM による回答生成を組み合わせた RAG を利用するため、単に日本語が得意であるだけでなく、検索された情報を理解して適切に回答する総合的な能力が重要になります。その点で、Qwen3 は今回の用途に適したモデルと考えられます。

また、Embedding モデルとして多言語対応の bge-m3 を利用します。「bge-m3 で多言語の文書を検索し、Qwen3 でその内容を理解して回答する」という構成との相性も良いと考えられます。限られた GPU リソースの中で、必要な日本語性能と汎用的な処理能力のバランスを取ったモデル選択と考えることができそうです。


ということで、Qwen3-8B-Q5_K_M.gguf をダウンロードして、 llm_models フォルダに配置します。そして、Domino IQ Configuration DB で設定し、Domino IQ に組み込みます。

正しく設定できると、サーバ起動時に LLM がロードされます。

[4094:0025-4594] 2026/08/14 20:40:11 DominoIQTask: AI エンジン実行中。読み込まれたモデル = Qwen3-8B-Q5_K_M.gguf


Embedding Model の登録

RAG サポートのセットアップの2つ目、「LLM Model 文書作成(Model Type = Embedding model)」の作業です。ここでは、Embedding Model を Domino IQ に登録します。

Domino IQ Configuration DB を開いて[Embedding Models]ビューを開き、[Add Model]をクリック、新しい文書を作成します。


Embedding Model の組み込み

Domino IQ Configuration DB の Configurations ビューを開き、既存の Domino IQ の設定文書を開き、編集します。

[Embedding Model]タブを開き、先ほど登録した Embedding Model を選択します。その他項目については、デフォルト値のままとします。

なお、Embedding model availability: の項目は、正しく設定完了すると『Embedding model copy succeeded; embedding model is available』に更新されます。

[Vector Database]タブはデフォルト値のままとします。

[Advanced]タブはサポート情報(KB0129110)に倣って入力します。

『例えば、「-c 327680」と「Number of Concurrent requests: 20」に設定すると、AI 推論エンジンにリクエストごとに 32768 トークンのコンテキストサイズが提供されます。』と記載があります。これだけでは何のことかよく分かりませんがが、チューニング時に必要となる項目のようですね。


トランザクションログの有効化

RAG サポートでは、Embedding Model を使ってベクトル化を行います(詳細は次回)。この操作では、トランザクションログの有効化が条件となります。

[352C:0002-287C] 2026/09/16 10:02:00 Index update process shutdown: Function only supported for transaction logged databases

DominoIQ の直接的な設定ではありませんが、ベクトル化を行う前に有効にしておきましょう。設定は、サーバ文書を編集し、[トランザクションログ]タブで行います。


0 件のコメント:

コメントを投稿