医療AIモデルがオフライン評価を終えた後、次に問うべきことは、医療者の画面にスコアを表示するかどうかだけではありません。モデルを取り巻くシステムが適切な入力を受け取り、必要な時点で出力を生成し、何が起きたかを説明できる記録を残せるかを確かめる必要があります。
その隔たりを調べる方法の一つが、前向きのサイレントモード評価です。通常業務と並行してシステムを動かしますが、その出力が診療に影響しないようにします。文献ではシャドーモード評価とも呼ばれ、AIが患者に影響する判断に関与する実臨床評価とは区別されています。[2]
この区別は実務上重要です。表示されないスコアを使えば、想定環境でのデータ到達やモデルの挙動を調べられます。しかし、スコアを見た医療者がより良い判断をすることを、それだけで示すことはできません。異なる問いには、異なるエビデンスの判断段階が必要です。
サイレントモードで確かめられること
この記事でいう前向きサイレントモードとは、あらかじめ定めたプロトコルに従って到着する症例を組み入れ、評価用システムを動かし、その出力を診療の意思決定から切り離すことです。過去のフォルダをモデルで再処理するだけの評価ではありません。また、少人数の医療者に出力を見せる試験導入でもありません。
境界を決めるのは導入規模ではなく、診療への影響です。放射線分野のDECIDE-AI解説では、シャドーモードを、実際の臨床状況でシステムを評価しながら、その状況には影響を与えない方法と説明しています。担当医療者が出力にアクセスできない場合などが例に挙げられています。[2]
サイレント評価では、次の二つの問いを分けることを推奨します。
- システムは仕様どおりに動くか。 入力の到達、適格性の確認、処理、タイミング、出力の可用性、追跡可能性を調べます。
- 固定したモデルは評価可能な集団でどう振る舞うか。 用途に適した参照標準と出力を比較し、不確実性や欠測ラベルをそのまま記録します。
どちらの結果も、診療が改善したという主張に置き換えてはいけません。DECIDE-AIが扱うのは、安全性やヒューマンファクターを含む初期の小規模な実臨床評価であり、サイレントモードの研究設計を指定するものではありません。[1] サイレント評価が良好でも、次の研究の計画に役立てられるだけで、その研究の代わりにはなりません。
接続前にワークフローを定義する
まず、将来のシステムがどの判断を支援するのかを決めます。誰が使うのか、どの患者や症例が対象となるのか、その時点でどの入力が存在すべきか、将来の出力がどの行動を支援するのかを明確にします。IMDRFの機械学習に関する優良実践の原則は、機器のライフサイクルの出発点に意図する目的と臨床ワークフローの文脈を置いています。[3]
仮の画像レビュー支援システムを考えてみましょう。将来の目的は、適切な資格を持つレビュー担当者が追加の注意を要する症例を見つけることかもしれません。サイレントモードでは、同じ到着画像の流れを評価しつつ、レビュー待ち行列を変えず、フラグを表示せず、報告書に推奨事項も追加しません。
境界は運用の言葉で書きます。診療用の待ち行列は変えない、AIの結果は独立した評価用ストレージへ保存する、診療チームには症例単位のAI通知を送らない、といった内容です。表示されたスコアに注意書きを添えるだけでは、この分離の代わりになりません。
実データに接続する前に、施設の診療、研究、プライバシー、セキュリティ、規制対応の責任者と、必要な許可や保護措置を合意してください。出力を隠せば評価がガバナンスの対象外になったり、インフラや機密性のリスクがなくなったりすると考えてはいけません。適用される要件は、個別の状況に応じて判断する必要があります。
重みだけでなくシステムを固定する
モデル、前処理、入力受入ルール、運用閾値、出力スキーマ、ソフトウェア依存関係を含む、バージョン管理された評価パッケージを推奨します。プロトコルのバージョンと想定運用環境も併せて記録します。
これがないと、画像変換や受入ルールの変更によって評価対象が変わっていても、モデルのファイル名は同じままになります。各予測を、それを生成したシステム全体のバージョンに結び付ける記録を残してください。
接続や記録機能の事前調整と、正式な評価期間は分けます。事前調整で連携やログの問題を解決し、開始条件を満たしてから計画した評価を始めます。評価中に実質的な変更が必要になった場合は、その理由と影響を受けた症例を記録し、プロトコル上、新たな評価期間が必要か判断します。互換性のないバージョンを説明なく一つの代表結果に混ぜてはいけません。
これは当社のエンジニアリング上の推奨であり、追跡可能性、再現性、データ完全性、ライフサイクルを通じたソフトウェア実践を重視するIMDRFの考え方と整合します。[3] 特定のバージョン管理ツールで規制適合性が確立するという主張ではありません。
スコアがない適格症例も数える
有用な評価記録は推論前から始まります。到着した症例ごとに、適格基準を満たしたか、必要な入力が届いたか、処理が完了したか、出力が想定した時間内に届いたかを記録します。
例えば、次の状態は区別して保持します。
- プロトコル上の対象外。
- 適格だが必要な入力がない。
- 入力は届いたが品質チェックで拒否された。
- 処理が失敗した、またはタイムアウトした。
- 出力は得られたが、想定した判断には間に合わなかった。
- 出力が時間内に得られた。
- 参照結果が未確定、または得られない。
これは症例管理のための提案であり、標準化された臨床分類ではありません。除外の中に失敗を隠さないよう、ワークフローに合わせて調整します。
運用上の完了状況は、すべての適格症例を分母として報告します。モデルの性能推定は、利用可能な出力と参照結果がそろった集合を明示して報告します。この二つの集合の違いを示してください。欠けた出力や遅れた出力は運用上の失敗状態であり、陰性予測ではありません。
この区別により、報告が「すべてがうまく動いたとき、モデルはどの程度正確だったか」だけに答えることを防げます。エンジニアリングチームには、システムが評価可能な記録を生成できなかった状況を把握する必要もあります。
判断時点の入力と参照結果を残す
症例が適格となった時点、入力が利用可能になった時点、推論が完了した時点、参照結果が確定した時点を記録します。後で記録に追加された情報ではなく、想定した判断時点で利用できた情報を使ってモデルを評価します。
不確実なラベルや意見の不一致の扱いも含め、参照標準をどう作成し、レビューするかを事前に定めます。IMDRFは、意図する目的に適合し、限界が理解されている参照標準を推奨しています。[3] 当社の参照標準のガイドでは、この設計上の課題を詳しく扱っています。
適切な場合は、参照評価の担当者にAI出力を見せないようにし、予測そのものが予測を判定する根拠に混ざらないようにします。結果が研究期間後に届く場合は、追跡中の状態と確定した陰性結果を区別します。結果の把握に避けられない限界があれば記録してください。
評価結果を見てから有利な閾値を選び、それを当初の前向き評価の結果として示してはいけません。まず、固定した方針での結果を報告します。その後の調整は開発作業として扱い、別途評価する必要があります。
稼働の準備と臨床的利益を分ける
単一の正解率ではなく、意図した問いを中心に報告を組み立てます。次の三つの部分を推奨します。
システムの稼働: 症例の全数把握、入力の可用性、拒否や失敗の理由、処理遅延、判断に必要な時間内に出力が得られた割合。
モデルの挙動: 事前に指定した運用点での性能、不確実性、十分な根拠がある場合のサブグループ別結果、誤りと参照結果の欠測の分析。IMDRFは、想定患者集団、関連するサブグループ、測定入力、潜在的な交絡要因を考慮した、臨床的に意味のある試験を求めています。[3]
研究の限界: 観察期間、集団のカバー範囲、未完了の結果、プロトコル逸脱、バージョン変更、結果を収集した診療環境。一つの施設の研究を、すべての施設や機器に通用する根拠として示してはいけません。この別の問いについては、外部検証のガイドを参照してください。
隠された方針ならレビュー対象としてフラグが付く症例数は、シミュレーション上のレビュー量として報告します。実測した医療者の業務量や時間削減とは呼ばないでください。医療者はまだ出力を使っていないため、その反応、レビュー時間、その後の行動は、この研究設計では測定されていません。
出力を遮断する境界を試験する
評価計画には、システムがサイレントな状態をどう保つかを記載します。推奨する確認項目には、アクセス権限、ダッシュボードの可視性、通知、報告書のエクスポート、待ち行列の順序変更、下流システムとの連携が含まれます。AIダッシュボードを誰も開かなくても、出力が間接的に診療へ影響することがあります。
評価サービスの障害が通常の診療経路を止めないことを試験します。運用アラート、プライバシー事故、プロトコル逸脱への対応責任者を定めます。意図せず出力が診療チームに届いた場合は、その露出を記録し、影響を評価してください。影響を受けた期間を完全なサイレント評価と呼び続けてはいけません。
開始前に、評価を中断する条件と、再開に必要な根拠を定めます。患者との誤った紐付け、意図しない出力の露出、通常システムへの継続的な干渉などが考えられます。具体的な基準は、ブログから借りた普遍的なチェックリストではなく、その場のリスク評価で決めます。
根拠に応じて次の段階を決める
研究の終了時には、停止する、修正して再実施する、さらに根拠を集める、範囲を限定して医療者に出力を提示する評価の許可を求める、といった判断を記録します。「サービスが動いた」ことをリリース基準にしてはいけません。
次の段階では、問いが、隠されたシステムの挙動から人とシステムの相互作用へ変わります。IMDRFは、機器を単独で評価するのではなく、想定環境での人とAIの相互作用を重視すると明示しています。[3] DECIDE-AIは、利用に伴うヒューマンファクターを含め、初期の実臨床評価を報告するための指針を示しています。[1]
次の研究では、適切な研究設計と承認の下で、利用者が出力をどう理解し、誤りにどう対応し、診療にどう組み込むかを調べる必要があります。サイレントモードの結果は、不確実性を明示したまま、その計画に役立てられます。
医療AIを構築するチームにとって有用な成果物は、孤立したスコアをもう一つ増やすことではありません。どのシステムが、どの症例で、いつ、どの境界の下で動き、どんな限界が未解決だったのかをレビューできる記録です。
ModAsteraは、フルスタックのヘルステック、医療AI、規制対象ソフトウェアの開発に取り組んでいます。オフライン評価から医療者への出力提示に進む準備をしている場合は、ワークフローとエビデンスの要件についてご相談ください。まず支援する判断を定め、その周囲にデータ、連携、評価の作業を設計します。