Task: LLM-Wiki生成の既定モデル選定(llmwiki両対応5モデル比較)
背景
decisions/0004の検証で、llmwikiが 要求するAPI機能(json_schema + tool_choice required)に両対応するOpenCode Goモデルは kimi-k2.6 / minimax-m3 / minimax-m2.7 / glm-5.2 / mimo-v2.5-pro の5つと判明。 kimi-k2.6には推論前置きの本文混入が観測されており、既定モデルが未決定だった。
目的
同一ソースで5モデルのcompileを比較し、既定モデルを決めてdecision 0004の未決定事項を 閉じる。
評価基準(Fable 5で設計)
同一の法令ソース(個人情報保護法 第2条、実運用と同質の日本語資料)で llmwiki compileを実行し、次を測る。
- 完走: compileがエラーなく完了するか
- concept抽出: 抽出された概念数(0=不合格。tasks/0003で観測した 「no concepts」の起きにくさ)
- 前置き混入: 生成ページ本文に英語の推論前置き(“The user wants”等)や メタ発話が混入しないか
- 日本語率: 本文の日本語文字比率(極端に低ければ英語で書いている)
- 所要時間: compile全体の壁時計時間
受け入れ条件
比較結果(2026-07-05、同一ソース=個人情報保護法第2条)
| モデル | 時間 | concepts | 前置き混入 | 日本語率 | 備考 |
|---|---|---|---|---|---|
| mimo-v2.5-pro | 175s | 7 | 0 | 0.67 | 既定に採用。出典忠実、概念名が簡潔 |
| glm-5.2 | 207s | 8 | 0 | 0.62 | 次点。忠実だがページ名に条項番号を含め長い |
| minimax-m2.7 | 210s | 7 | 0 | 0.67 | 不採用: ソースにない事実(施行日等)を補筆 |
| kimi-k2.6 | 27s | 0 | — | — | concept抽出0件で不合格(信頼性不足) |
| minimax-m3 | 14s | 0 | — | — | concept抽出0件で不合格 |
判定理由: 完走した3モデルはいずれも前置き混入なし。minimax-m2.7は条文に書かれて いない施行日・改正経緯を本文に加えており、AGENTS.mdの「出典に書かれていないことを 補わない」に反するため除外。mimo-v2.5-proとglm-5.2はともに出典忠実だが、mimoの方が 速く、概念ページ名が「仮名加工情報」のような素の概念名で、複数ソースをまたぐ概念 統合(同一概念1ページ)に向く。glm-5.2は「仮名加工情報(個人情報保護法第2条第5項)」 のような条項付き命名で、ソースごとにページが分裂する懸念がある。 なお過去にkimi-k2.6でcompile成功例があるため(tasks/0002)、0件は決定論的な失敗では なく信頼性のばらつき。既定には採用しない。
確認方法
make check