自己申告の確信度は、粗探しの代わりにならない

LayerXの飛田氏は、デザイン段階の手戻りを分析する中で、手戻りそのものを二種類に分けている。対象ユーザーや権限表示、データ実態、UI状態パターンなど「画面設計前に判明すべきだった」防げる手戻りと、デザインシステム準拠性やマイクロインタラクションなど「実装後にしか判明しない」健全な手戻り。前者を減らすことが、氏の設計の狙いだ(出典)。

氏が採った方法は、AIに仕様を作らせて終わりにしないことだった。「出力された『っぽい』仕様が『本当に網羅すべき仕様』を満たしているかはAIは保証してくれない」という前提のもと、PRD・Spec・デザインを作るBuild Agentとは別に、「粗探しだけを責務とする」Review Agentを立てる。氏の記述では、この敵対的レビュー用のエージェントは「PRD作成や実装とはコンテクストを共有せず」動く。FAILが出れば適切なフェーズへ差し戻し、PASSが出るまでループする。

人間が確認すれば十分だと思っていた

PRレビューツールParryは、Why・Risk・Confidence・Contextという四軸をAIに書かせ、人間がそれを確認する。書く側(AI)と確認する側(人間)が別の主体である以上、この構図はすでに飛田氏の言うコンテキスト分離を満たしているように見えた。人間はAIではないのだから、粗探し役として十分機能するはずだという読み方だ。

自分がこの週書いた7本のPRを振り返って気づいた

だが、飛田氏の設計で分離されているのは「主体が違うこと」ではなく「コンテクストが共有されていないこと」だ。この観点で、今週分の記事を7本書いてPRを送る作業そのものを振り返ってみる。7本すべてで、Why・Risk・Confidenceという四軸を書いたのは、その記事を実際に執筆した自分自身であり、Confidenceの欄には毎回「high」と書いた。記事を書き終えた直後の、まだ内容を隅々まで把握している同じ文脈のまま、その内容への確信度を自分で申告していたことになる。

これは、Build AgentがPRDを書いた直後に「このPRDの精度はhighです」と自己採点しているのと、構造としては変わらない。人間が最終的に確認するとしても、確認する材料である四軸の中身自体が、粗探しを一度も経ていない自己申告のまま提出されている。

別主体であることと、別文脈であることは違う

飛田氏の設計がわざわざ新規エージェントを立てて「PRD作成や実装とはコンテクストを共有せず」という条件を明記しているのは、主体を分けるだけでは不十分だと分かっているからだ。同じ文脈を引き継いだ別人格が確信度を評価しても、見落としは引き継がれたまま残る。Parryの四軸が「AIが書き、人間が確認する」という別主体の構図を持っていても、その四軸の中身自体が粗探しなしの自己申告であるなら、人間が確認する前の材料の質は、飛田氏が防ごうとしている問題をすでに孕んでいることになる。

学びが自動で積み上がる仕組みは、まだどちらにもない

飛田氏はこの記事の中で、自身の設計にも未解決の問題があることを認めている。敵対的レビューは精度が高い一方で最終出力までとても時間がかかり、理想として掲げているのは「レビューが開発組織内で回るたびに学びが積み上がって、精度が自動向上する」ことだが、それはまだ実現していない。

Parryの四軸についても同じことが言える。今回の7本のConfidenceを、コンテクストを共有しない別のレビュー役に粗探しさせていたら、highという自己申告のうちいくつが差し戻されていたのかは、試していないので分からない。自己申告の確信度をそのまま人間の確認に渡す運用と、飛田氏の言う敵対的レビューループを挟む運用との差が、実際の見落とし件数としてどれだけ出るのかは、今回の記事の材料だけでは検証できていない。