自治体における生成AI研修の理解度テスト設計|ガバナンス・倫理・実務スキルの統合的評価モデル

自治体の生成AI研修は「受講したか」より「判断できるか」が重要

生成AIを導入する自治体が増えるなか、職員向け研修も「生成AIとは何か」を学ぶ段階から、実際の行政業務で安全に使いこなす段階へ移りつつある。

文章の要約、議事録作成、庁内FAQの検索、広報文案の作成、アンケート分析など、生成AIを活用できる業務は幅広い。一方で、個人情報や機密情報の入力、誤った回答の利用、著作権侵害、特定の住民に不利益を与える判断など、自治体特有のリスクも存在する。

そのため、研修後に行う理解度テストは、用語や禁止事項を暗記しているかだけを確認するものでは不十分である。

求められるのは、職員が自分の担当業務に照らしてリスクを発見し、利用の可否を判断し、必要な確認や修正を加えながら生成AIを活用できるかを測る仕組みである。

デジタル庁は2026年6月、「行政の進化と革新のための生成AIの調達・利活用に係るガイドライン(第2.0版)」を公表した。これは国の政府職員向けの規範文書だが、地方公共団体でも必要に応じて参考にすることが期待されている。生成AIの利活用促進とリスク管理を表裏一体で進めるという考え方は、自治体研修の評価にも反映させる必要がある。デジタル庁「生成AIガイドライン第2.0版」

従来型の理解度テストでは実務能力を測れない

自治体の研修でよく見られるのが、次のような正誤問題である。

「生成AIの回答は、常に正確である。正しいか、誤りか」

この問題に正解しても、実際の業務でAIの誤りを見つけられるとは限らない。職員が「生成AIは間違えることがある」と知っていることと、生成された条例解説や住民向け文章の誤りを一次情報から検証できることは、異なる能力だからである。

理解度テストでは、少なくとも次の3段階を区別する必要がある。

  • ルールやリスクを知っている
  • 具体的な状況で適切な対応を判断できる
  • 業務に合わせて安全な指示や手順を設計できる

研修の目的が業務活用である以上、テストも知識確認だけで終わらせず、判断と実技まで含めて設計することが重要になる。

カークパトリックモデルとブルームのタキソノミーを組み合わせる

研修効果を整理する枠組みとして、カークパトリックの4段階評価モデルがある。

  1. 反応:研修への満足度や受容度
  2. 学習:知識、スキル、態度の習得
  3. 行動:職場での行動変容
  4. 結果:業務や組織にもたらした成果

理解度テストが主に測るのは第2段階の「学習」である。しかし、研修を実務改善につなげるには、テスト結果を第3段階の「行動」、第4段階の「結果」へ接続しなければならない。

設問の難易度設計には、ブルームのタキソノミーも活用できる。

記憶

禁止事項、入力してはいけない情報、利用可能なツールなどを正しく覚えているかを測る。

理解

なぜ個人情報の入力が問題になるのか、なぜファクトチェックが必要なのかを自分の言葉で説明できるかを測る。

応用

税務、福祉、広報、防災など、自分の担当業務で生成AIをどこに使えるかを判断できるかを測る。

分析・評価

AIの回答に含まれる誤り、論理の飛躍、バイアス、根拠不足を発見し、採用の可否を判断できるかを測る。

創造

目的、役割、前提条件、出力形式、禁止事項を整理したプロンプトや業務フローを設計できるかを測る。

自治体向け理解度テストを構成する3つの評価領域

政策・ガバナンスと倫理

第一の領域は、国や自治体のガイドライン、内部規程、公務員としての倫理原則を理解し、実務へ適用する能力である。

主な評価項目には次のようなものがある。

  • 自治体の生成AI利用ルールを理解している
  • 利用可能な業務と禁止・要相談業務を区別できる
  • 住民の権利に影響する判断をAIだけに委ねない
  • AIの判断過程や利用目的について説明責任を意識できる
  • 特定の属性や立場に偏った回答を見抜ける
  • 問題が発生した場合の報告・相談ルートを理解している

特に、福祉給付、保育所入所、税務、採用、補助金審査など、住民の権利や生活に大きな影響を与える業務では、人間による最終判断を外してはならない。

テストでは、単に「人間の確認が必要である」と答えさせるのではなく、どの段階で誰が確認し、どの記録を残すべきかまで考えさせる必要がある。

情報セキュリティとリスク管理

第二の領域では、生成AIへの入力情報と出力結果に関するリスク対応力を評価する。

主な評価項目は次のとおりである。

  • 個人情報、要配慮個人情報、機密情報を識別できる
  • マスキングや匿名化の必要性を判断できる
  • 利用する生成AIサービスのデータ利用条件を確認できる
  • ハルシネーションを前提として回答を検証できる
  • 著作権や第三者の権利に配慮できる
  • インシデント発生時の報告手順を理解している
  • 出典、操作履歴、修正内容など必要な記録を残せる

個人情報保護委員会は、行政機関等が生成AIサービスへ個人情報を入力する場合、利用目的の範囲内か、サービス提供者が入力情報を機械学習に利用しないかなどを十分確認するよう注意喚起している。個人情報保護委員会「生成AIサービスの利用に関する注意喚起」

したがって、テストでは「個人情報を入力してはいけない」という一律の暗記ではなく、利用環境、契約条件、情報分類、匿名化の状態を踏まえて判断できるかを測ることが重要である。

プロンプト設計と業務プロセスの再構築

第三の領域では、生成AIを実際の行政業務で使うための実務スキルを評価する。

評価対象となるのは、単に長いプロンプトを書ける能力ではない。

  • 業務目的を明確にできる
  • AIに適切な役割を与えられる
  • 対象者や利用場面を指定できる
  • 入力情報と出力条件を分離できる
  • 文字数、文体、形式などの制約を設定できる
  • 根拠や参照資料の提示を求められる
  • AI出力後の人間による確認工程を設計できる

例えば、「防災情報を要約してください」という指示だけでは、対象者、重要情報、文字数、表現上の配慮が不足している。

「市の防災担当者として、添付した避難情報を基に、高齢者にも分かりやすいSNS投稿文を200字以内で作成してください。避難場所、対象地域、発令時刻を省略せず、資料にない情報は追加しないでください」といった構造化された指示を作れるかを評価する。

選択・シナリオ・実技の3層でテストを設計する

自治体向け理解度テストは、次の3層構造にすると実務能力を測りやすい。

テスト区分主な測定対象設問形式の例
選択・正誤判断基本ルール、用語、禁止事項四肢択一、複数選択、正誤問題
シナリオ判断倫理、リスク、業務上の判断事例を読み、対応策と理由を選ぶ
実技・記述プロンプト設計、検証、業務改善指示文作成、回答修正、確認手順の記述

一例として、選択問題20点、シナリオ問題40点、実技問題40点の100点構成が考えられる。これは公的な統一基準ではなく、実務判断を重視する場合の設計例である。実際の配点は、研修対象者の職種や利用範囲に応じて調整する。

自治体業務を想定した設問例

シナリオ判断問題

保育所の入所選考業務を効率化するため、申請者の家庭状況と過去の選考結果を生成AIへ入力し、優先順位と合否を自動決定する提案が出された。最も適切な対応はどれか。

A. 過去データが十分あれば、そのまま自動決定する
B. 氏名だけを削除して自動決定する
C. AIは審査の補助に限定し、基準の適法性や公平性を確認したうえで、人間が最終判断する
D. 作業時間が短縮される場合に限り自動決定する

正解:C

採点では、正解を選べたかだけでなく、個人情報、公平性、説明責任、人間による最終判断という複数の論点を説明できるかも確認する。

ファクトチェック問題

生成AIが、実在しない条例名を根拠として住民向け回答文を作成した。職員が取るべき対応を記述させる。

模範的な回答には、次の要素を含める。

  • AIの回答をそのまま公開しない
  • 例規集や所管省庁などの一次情報を確認する
  • 条例名、条文、施行日、対象条件を照合する
  • 必要に応じて法務・担当部署へ確認する
  • 修正内容や確認に使った資料を記録する
  • 重大な誤出力は所定の窓口へ共有する

プロンプト実技問題

市民向けの長文防災ガイドを、高齢者と若年層に向けた2種類のSNS投稿へ変換するプロンプトを作成させる。

採点基準には次の項目を設定する。

  • 目的と対象者が明確か
  • 参照資料の範囲が指定されているか
  • 重要事項を省略しない指示があるか
  • 文字数や出力形式が指定されているか
  • 資料にない情報を追加しない制約があるか
  • 最終確認を人間が行う前提になっているか

合格基準は総合点だけで決めない

理解度テストで避けたいのが、総合点だけによる合否判定である。

プロンプト作成が得意でも、個人情報や倫理に関する理解が不十分であれば、安全な業務利用は難しい。反対に、ルールを暗記していても、実務課題に対する指示を作れなければ活用は進まない。

設計例としては、次のような複数条件を設定する。

  • 総合得点が基準以上である
  • 3つの評価領域すべてが最低基準を満たしている
  • 個人情報、機密情報、人間による最終判断などの重要問題に正解している
  • 実技問題で重大な禁止事項違反がない

重要問題を「クリティカル項目」として設定し、総合点が高くても重大なリスク判断を誤った場合は、再学習の対象とする方法が有効である。

テスト結果を研修改善と組織学習につなげる

理解度テストの目的は、職員を監視したり順位付けしたりすることではない。組織として不足している能力を発見し、必要な支援につなげることである。

結果は個人別の点数だけでなく、次のように分析する。

  • 部署別に誤答が多いリスク領域
  • 初心者と実務利用者の理解度の差
  • 知識は高いが実技が低い職員の割合
  • プロンプト実技は高いが倫理判断が弱い傾向
  • 研修前後における判断力の変化
  • 再研修後の改善状況

優秀なプロンプトやシナリオ問題への優れた回答は、本人の許可や組織ルールのもとで庁内のプロンプトライブラリ、FAQ、研修教材へ反映する。これにより、個人のノウハウを組織の知識として蓄積できる。

また、テスト結果は研修部門だけで管理するのではなく、AIガバナンスを担当する責任者、DX推進部門、情報セキュリティ部門などへ集約し、利用ルールや研修内容の見直しに活用することが望ましい。

理解度テストは定期的に更新する

生成AIはモデル、機能、利用規約、連携サービスが短期間で変化する。AIエージェントやノーコード開発環境が普及すれば、職員は文章の作成者だけでなく、業務フローや簡易アプリを設計する立場にもなる。

そのため、テストを一度作って終わりにしてはならない。

  • 利用するAIサービスが変更されたとき
  • 自治体の利用ガイドラインを改定したとき
  • 新しい業務への利用を開始したとき
  • インシデントやヒヤリハットが発生したとき
  • 国のガイドラインや関連法令が改定されたとき

こうしたタイミングで設問と採点基準を見直す必要がある。

まとめ

自治体の生成AI研修における理解度テストは、知識を確認するだけの小テストではない。職員が住民の権利と行政への信頼を守りながら、生成AIを実務で活用できるかを確認するためのガバナンス手段である。

評価領域は、政策・ガバナンスと倫理、情報セキュリティとリスク管理、プロンプト設計と業務プロセスの再構築という3つに分ける。

そのうえで、選択・正誤問題、シナリオ判断、実技・記述を組み合わせれば、知識、判断、実践の各能力を立体的に評価できる。

さらに、結果を再研修、利用ルールの改善、プロンプト共有、業務成果の測定へつなげることで、理解度テストは単なる合否判定ではなく、自治体全体のAI活用力を継続的に高める仕組みとなる。

参考資料

コメント

この記事へのコメントはありません。

新着の記事
注目記事
お知らせ
  1. AI活用人材のスキルマップと社内認定制度の設計方法|評価・育成・配置をつなぐ実践手順

  2. AI時代の会社概要ページは「信頼データベース」へ|AEOとE-E-A-Tを両立する設計・実装戦略

  3. 生成AIとRPAの融合で製造業バックオフィスを変える|業務自動化からDXへ進む実践方法

  4. 自治体AI共同利用の責任分界点モデル|安全な共同基盤と実効的な利用規程の作り方

  5. RAG時代のAI検索最適化|生成エンジンに参照される記事構造とFAQ設計

  1. 生成AIで顧客インタビュー記事制作を効率化する方法|品質を落とさない5段階ワークフロー

  2. 介護記録に生成AIを使う前に決めるべき入力禁止情報|2026年版の安全な運用ルール

  3. Google Workspace導入企業のGemini活用KPI設計|ROIを高める測定と運用の実務

  4. 生成AI時代のE-E-A-Tと著作権管理|AI検索で評価されるコンテンツの条件

  5. 生成AI導入時の情報ガバナンスとは?入力禁止情報と情報分類ルールの作り方

  1. 【イベント開催のお知らせ】AI活用セミナーを開催します

  2. 自治体に向けて生成AI実装・定着支援の提案を行いました

  3. AI活用勉強会を開催しました

  4. 地方自治体に向けて、人事評価・人材情報の可視化に関する提案を行いました

  5. 地域金融機関向けに「AIを活用した企業支援モデル」をご提案しました

関連記事