Task: LLM-Wiki生成の既定モデル選定(llmwiki両対応5モデル比較)

背景

decisions/0004の検証で、llmwikiが 要求するAPI機能(json_schema + tool_choice required)に両対応するOpenCode Goモデルは kimi-k2.6 / minimax-m3 / minimax-m2.7 / glm-5.2 / mimo-v2.5-pro の5つと判明。 kimi-k2.6には推論前置きの本文混入が観測されており、既定モデルが未決定だった。

目的

同一ソースで5モデルのcompileを比較し、既定モデルを決めてdecision 0004の未決定事項を 閉じる。

評価基準(Fable 5で設計)

同一の法令ソース(個人情報保護法 第2条、実運用と同質の日本語資料)で llmwiki compileを実行し、次を測る。

  1. 完走: compileがエラーなく完了するか
  2. concept抽出: 抽出された概念数(0=不合格。tasks/0003で観測した 「no concepts」の起きにくさ)
  3. 前置き混入: 生成ページ本文に英語の推論前置き(“The user wants”等)や メタ発話が混入しないか
  4. 日本語率: 本文の日本語文字比率(極端に低ければ英語で書いている)
  5. 所要時間: compile全体の壁時計時間

受け入れ条件

比較結果(2026-07-05、同一ソース=個人情報保護法第2条)

モデル 時間 concepts 前置き混入 日本語率 備考
mimo-v2.5-pro 175s 7 0 0.67 既定に採用。出典忠実、概念名が簡潔
glm-5.2 207s 8 0 0.62 次点。忠実だがページ名に条項番号を含め長い
minimax-m2.7 210s 7 0 0.67 不採用: ソースにない事実(施行日等)を補筆
kimi-k2.6 27s 0 concept抽出0件で不合格(信頼性不足)
minimax-m3 14s 0 concept抽出0件で不合格

判定理由: 完走した3モデルはいずれも前置き混入なし。minimax-m2.7は条文に書かれて いない施行日・改正経緯を本文に加えており、AGENTS.mdの「出典に書かれていないことを 補わない」に反するため除外。mimo-v2.5-proとglm-5.2はともに出典忠実だが、mimoの方が 速く、概念ページ名が「仮名加工情報」のような素の概念名で、複数ソースをまたぐ概念 統合(同一概念1ページ)に向く。glm-5.2は「仮名加工情報(個人情報保護法第2条第5項)」 のような条項付き命名で、ソースごとにページが分裂する懸念がある。 なお過去にkimi-k2.6でcompile成功例があるため(tasks/0002)、0件は決定論的な失敗では なく信頼性のばらつき。既定には採用しない。

確認方法

make check