Claude 学習
カリキュラム

効果が実証された学習技法 — エビデンス調査レポート

PEDAGOGY.md の付録。リサーチエージェントによる調査(2026-07-12)。Web検索と一次文献(PDF全文含む)の照合により、Dunlosky et al. (2013) 以降2020年代のメタ分析・レビューまで確認。効果量はすべて出典の原文または出典を直接引用したメタ分析本文で確認済み。確認できなかった数値は「未確認」と明記。


1. 出発点: Dunlosky et al. (2013) の10技法評価と、その後の更新

主要文献: Dunlosky, Rawson, Marsh, Nathan & Willingham (2013) Psychological Science in the Public Interest, 14(1), 4–58. DOI: 10.1177/1529100612453266

2013年の評価 技法
高有用性 検索練習(practice testing)、分散学習(distributed practice)
中程度 精緻化質問、自己説明、インターリービング
低有用性 要約、ハイライト、キーワード記憶術、イメージ化、再読

2021年の定量的更新: Donoghue & Hattie (2021) Frontiers in Education(DOI: 10.3389/feduc.2021.581216)が10技法をメタ分析(242研究、1,619効果、N=169,179、全体平均 d=0.56)。

つまり「順位づけは追試でほぼ再現されたが、"低有用性"技法もゼロではない(実装次第)」が2020年代の見方。低有用性技法の「正しい使い方」は Miyatsu, Nguyen & McDaniel (2018) Perspectives on Psychological Science(PMID: 29716455)が整理している(例: ハイライトは「読んだ後に選別的に引き、後で検索練習の材料にする」なら害が減る)。


2. 検索練習(retrieval practice / testing effect)— 最強のエビデンス

エビデンス強度: ◎(複数の大規模メタ分析で中〜大の効果量、教室実験でも再現)

メタ分析 対象 効果量
Rowland (2014) Psych. Bulletin 140(6) DOI: 10.1037/a0037559 実験室研究159効果 g=0.50 [0.42, 0.58](vs 再学習)
Adesope, Trevisan & Sundararajan (2017) Rev. of Educational Research 87(3) DOI: 10.3102/0034654316689306 272効果 全体 g=0.61 [0.58, 0.65]、vs 再学習 g=0.51、vs 無活動 g=0.93
Yang, Luo, Vadillo, Yu & Shanks (2021) Psych. Bulletin 147(4) DOI: 10.1037/bul0000309全文PDFで確認) 教室研究のみ 222研究・48,478人 g=0.499 [0.442, 0.557]
Agarwal, Nunes & Blunt (2021) Educ. Psych. Review 33 DOI: 10.1007/s10648-021-09595-9 実教室50実験の系統的レビュー 57%の効果が中〜大(d>0.50)

古典: Roediger & Karpicke (2006) Psychological Science(PMID: 16507066)— 5分後は再読が勝つが、2日後・1週間後はテスト条件が逆転して勝つ。しかも学習者の自信は再読条件の方が高い(=メタ認知の錯覚、§7)。

最新レビュー: Carpenter, Pan & Butler (2022) "The science of effective learning with spacing and retrieval practice" Nature Reviews Psychology, 1, 496–511. DOI: 10.1038/s44159-022-00089-1

フィードバックの影響(Yang et al. 2021 本文で確認):

形式(自由再生 vs 選択式)の差(Yang et al. 2021):

教材への実装案:

  1. 各セクション末尾に必ず3〜8問のクイズブロック。形式は穴埋め・短答を主軸、多肢選択を補助に(どれでも効くが、再生型を優先)
  2. 即時の正誤フィードバック+正答の解説を必ず表示(Yang 2021 の feedback 効果に基づく)
  3. 成績に関係ない低ステークス設計でよい — 「間違えても失うものはない」ことをUIで明示
  4. 本文を読む前のプレクイズ(事前テスト)も1〜2問置く。失敗しても事後学習を促進する(pretesting effect; Richland, Kornell & Kao 2009, JEP: Applied, 15(3), 243–257, DOI: 10.1037/a0016496)
  5. 進捗トラッカーは「読了率」でなく「クイズ正答率×経過日数」を保持指標として記録
  6. 同一知識を別形式で再出題する問題プールを持つ(穴埋め→短答→応用問題)。形式不一致でも転移することが実証済み

3. 分散学習(spacing)と「間隔×検索」= successive relearning

エビデンス強度: ◎(100年分の研究、メタ分析多数)

主要文献:

拡張間隔 vs 均等間隔の現在の見解: Latimier et al. (2021) が54効果を統合した結果、拡張スケジュールと均等スケジュールの差は g=0.034(95%CI [-0.10, 0.17], SE=0.06)で有意差なし。「1日→3日→7日→…」と広げても「3日おき固定」でも大差ない。重要なのはスケジュールの形状ではなく、間隔をあけること自体と総反復回数。Carpenter et al. (2022) も同見解。

successive relearning(連続的再学習): 検索練習×分散の組み合わせ。「初回セッションで基準(例: 3回連続正答)まで検索練習→数日後にまた基準まで再学習→を複数回」

教材への実装案:

  1. 復習キュー機能を教材サイトに内蔵: 各クイズ項目に次回復習日を持たせ、トップページに「今日の復習」を表示
  2. successive relearning モード: 達成した項目だけ次回セッションへ送り、セッション跨ぎの正答回数をバッジ表示
  3. 章末に「前章までの混ぜ込み復習クイズ」(累積復習)

4. インターリービング(interleaving)

エビデンス強度: ○(メタ分析で中程度、ただし領域依存性が強い)

主要文献: Brunmair & Richter (2019) "Similarity matters" Psych. Bulletin, 145(11), 1029–1052 DOI: 10.1037/bul0000209。59研究のメタ分析で全体 g=0.42

効く領域 / 効かない領域(同メタ分析より):

教室での実証: Rohrer, Dedrick, Hartwig & Cheung (2020) J. Educational Psychology, 112(1), 40–52(全文PDFで確認)。中1数学54クラスのRCTで、1ヶ月後の抜き打ちテストが混合練習61% vs ブロック練習38%、d=0.83

教材への実装案: 混同しやすい概念ペアの対比クイズ(「AとBどちらか」形式)。累積混合ドリル。UI に「バラバラに出るのは仕様」の理由明示(主観的難度で離脱させない)。語彙・用語カードは無理にシャッフルしない。


5. 望ましい困難(desirable difficulties, Bjork)

エビデンス強度: ○(枠組みとしては各効果に支えられるが、「困難なら何でも良い」わけではない)

主要文献: Bjork & Bjork (2020) JARMAC, 9(4), 475–479(PDF)。概念の初出は Bjork (1994)。中核例=検索練習・分散・インターリービング・文脈の変動。

反証条件: Chen, Castro-Alonso, Paas & Sweller (2018) Frontiers in Psychology DOI: 10.3389/fpsyg.2018.01483要素間相互作用が高い(複雑な)教材では、テスト効果・生成効果が消失・逆転しうる(ワーキングメモリ過負荷)。

誤解されやすい点:

  1. 「学習中のパフォーマンス低下・困難感 = 悪い学習」ではない(学習と成績の区別)。逆に「スラスラ進む=良い学習」でもない
  2. 困難は前提知識で乗り越えられる場合のみ望ましい。装備がない学習者には undesirable になる
  3. 初学者×複雑教材では worked example が生成より優る — 熟達に応じて足場を外す(expertise reversal)

教材への実装案: 「例示→穴埋め→自由再生」のフェーディング系列。主要メトリクスは学習中の成績でなく遅延テストの成績


6. 精緻化質問・自己説明・生成効果

6a. 精緻化質問(elaborative interrogation)

6b. 自己説明(self-explanation, Chi)

6c. 生成効果(generation effect)


7. メタ認知の錯覚(fluency illusion・較正)

エビデンス強度: ◎(現象自体は頑健に再現)

教材への実装案:

  1. 確信度付きクイズ: 回答時に自信(低/中/高)を選ばせ、較正チャート(自信×正答率)を表示。「高確信×不正解」を強調して再学習キューへ
  2. 予測→実測フィードバック: セッション開始時の予測と実績の差分を表示
  3. 「読了」を成果として扱わない: 進捗はクイズ通過ベース
  4. 教材内で錯覚の存在自体を教える(メタ認知教育)

8. エビデンスが弱い・俗説と明記すべきもの

主張 実際 出典
学習スタイル適合 「神話」。meshing の証拠は事実上皆無。教育者の89.1%(15,045人・18ヶ国)が信じている。直接検証の効果量 d=0.04 Pashler et al. (2008) PSPI; Newton & Salvi (2020); 2025年整理
ハイライト・下線引き 単独では低有用性。選別的に引いて検索練習の素材にするなら害減 Dunlosky et al. 2013; Miyatsu et al. 2018
再読 1週間後にはテスト練習に劣り、自信だけが残る Roediger & Karpicke 2006
要約 訓練なしでは低有用性 Dunlosky et al. 2013
「拡張間隔が均等間隔より優れる」 俗説寄り。メタ分析で差なし(g=0.034, n.s.) Latimier et al. 2021
「フィードバックなしでも十分」 教室データでは有が明確に優位(g=0.537 vs 0.374) Yang et al. 2021
「インターリービングは万能」 語彙学習では逆効果(g=−0.39) Brunmair & Richter 2019
「努力感があれば良い学習」 誤読。前提知識がない・複雑すぎる場合は undesirable に転じる Bjork & Bjork 2020; Chen et al. 2018

9. 統合: 実装優先度

①検索練習(フィードバック付き)→ ②分散復習スケジューラ → ③確信度・較正トラッカー → ④混合演習(判別系のみ)→ ⑤自己説明プロンプト の順に実装価値が高い。

未確認事項

(1) McCurdy et al. (2020) の生成制約別の具体的効果量、(2) Higham et al. (2022) の正確なDOI、(3) Pressley et al. (1987)・Chi et al. (1994) の原文(二次文献経由で確認)、(4) successive relearning の「約1成績段階の向上」はレビュー解説記事経由の数値。

Claude 学習サイト — 完全ローカル静的サイト(build.py で生成)。進捗はこのブラウザの localStorage に保存されます。