効果が実証された学習技法 — エビデンス調査レポート
PEDAGOGY.md の付録。リサーチエージェントによる調査(2026-07-12)。Web検索と一次文献(PDF全文含む)の照合により、Dunlosky et al. (2013) 以降2020年代のメタ分析・レビューまで確認。効果量はすべて出典の原文または出典を直接引用したメタ分析本文で確認済み。確認できなかった数値は「未確認」と明記。
1. 出発点: Dunlosky et al. (2013) の10技法評価と、その後の更新
主要文献: Dunlosky, Rawson, Marsh, Nathan & Willingham (2013) Psychological Science in the Public Interest, 14(1), 4–58. DOI: 10.1177/1529100612453266
| 2013年の評価 | 技法 |
|---|---|
| 高有用性 | 検索練習(practice testing)、分散学習(distributed practice) |
| 中程度 | 精緻化質問、自己説明、インターリービング |
| 低有用性 | 要約、ハイライト、キーワード記憶術、イメージ化、再読 |
2021年の定量的更新: Donoghue & Hattie (2021) Frontiers in Education(DOI: 10.3389/feduc.2021.581216)が10技法をメタ分析(242研究、1,619効果、N=169,179、全体平均 d=0.56)。
- 分散学習 d=0.85、検索練習 d=0.74 → 上位2位は2013年の高評価と一致
- 精緻化質問 d=0.56、イメージ化 d=0.56、自己説明 d=0.54、記憶術 d=0.50、再読 d=0.47、インターリービング d=0.47、下線引き d=0.44、要約 d=0.44
- 重要な留保: (1) 効果は表層的・事実的学習(d=0.60)に偏り、深い学習では d=0.26 に低下。(2) 近転移 d=0.61 vs 遠転移 d=0.39。(3) 低学力層で効果が大きく、高学力層では一部技法が負の効果。(4) 74% の研究が学習後1日以内の測定で、長期保持の証拠は薄い。(5) 効果量と研究年に相関なし(r=0.08)— 結論は時代を通じて安定
つまり「順位づけは追試でほぼ再現されたが、"低有用性"技法もゼロではない(実装次第)」が2020年代の見方。低有用性技法の「正しい使い方」は Miyatsu, Nguyen & McDaniel (2018) Perspectives on Psychological Science(PMID: 29716455)が整理している(例: ハイライトは「読んだ後に選別的に引き、後で検索練習の材料にする」なら害が減る)。
2. 検索練習(retrieval practice / testing effect)— 最強のエビデンス
エビデンス強度: ◎(複数の大規模メタ分析で中〜大の効果量、教室実験でも再現)
| メタ分析 | 対象 | 効果量 |
|---|---|---|
| Rowland (2014) Psych. Bulletin 140(6) DOI: 10.1037/a0037559 | 実験室研究159効果 | g=0.50 [0.42, 0.58](vs 再学習) |
| Adesope, Trevisan & Sundararajan (2017) Rev. of Educational Research 87(3) DOI: 10.3102/0034654316689306 | 272効果 | 全体 g=0.61 [0.58, 0.65]、vs 再学習 g=0.51、vs 無活動 g=0.93 |
| Yang, Luo, Vadillo, Yu & Shanks (2021) Psych. Bulletin 147(4) DOI: 10.1037/bul0000309(全文PDFで確認) | 教室研究のみ 222研究・48,478人 | g=0.499 [0.442, 0.557] |
| Agarwal, Nunes & Blunt (2021) Educ. Psych. Review 33 DOI: 10.1007/s10648-021-09595-9 | 実教室50実験の系統的レビュー | 57%の効果が中〜大(d>0.50) |
古典: Roediger & Karpicke (2006) Psychological Science(PMID: 16507066)— 5分後は再読が勝つが、2日後・1週間後はテスト条件が逆転して勝つ。しかも学習者の自信は再読条件の方が高い(=メタ認知の錯覚、§7)。
最新レビュー: Carpenter, Pan & Butler (2022) "The science of effective learning with spacing and retrieval practice" Nature Reviews Psychology, 1, 496–511. DOI: 10.1038/s44159-022-00089-1
フィードバックの影響(Yang et al. 2021 本文で確認):
- Rowland (2014): フィードバック有 g=0.73 vs 無 g=0.39(約2倍)
- Adesope et al. (2017): 有 g=0.63 vs 無 g=0.60(差なし)と食い違っていたが、
- Yang et al. (2021) が教室データで決着: 有 g=0.537 > 無 g=0.374(有意)→ 正誤フィードバックは付けるべき
形式(自由再生 vs 選択式)の差(Yang et al. 2021):
- マッチング g=0.913、穴埋め g=0.773、短答 g=0.638、多肢選択 g=0.567、手がかり再生 g=0.316、自由再生 g=0.238 — ただし形式は統計的に有意なモデレータではなく「どの形式でも効く」
- 実験室系の Rowland (2014) では再生型(recall)>再認型(recognition)
- クイズと本試験の形式が一致すると効果大(g=0.531 vs 0.399)だが、不一致でも有意な効果あり
- 出題されなかった関連知識にも波及(g=0.321)、事実(g=0.524)・概念理解(g=0.644)・応用(g=0.453)まで効く。転移のメタ分析は Pan & Rickard (2018) Psych. Bulletin 144(7), d=0.40 [0.31, 0.50](PMID: 29733621)
- 低ステークス(成績に響かない)クイズでも効果は同等(g=0.477 vs 高ステークス 0.441)。反復回数が多いほど効果増
教材への実装案:
- 各セクション末尾に必ず3〜8問のクイズブロック。形式は穴埋め・短答を主軸、多肢選択を補助に(どれでも効くが、再生型を優先)
- 即時の正誤フィードバック+正答の解説を必ず表示(Yang 2021 の feedback 効果に基づく)
- 成績に関係ない低ステークス設計でよい — 「間違えても失うものはない」ことをUIで明示
- 本文を読む前のプレクイズ(事前テスト)も1〜2問置く。失敗しても事後学習を促進する(pretesting effect; Richland, Kornell & Kao 2009, JEP: Applied, 15(3), 243–257, DOI: 10.1037/a0016496)
- 進捗トラッカーは「読了率」でなく「クイズ正答率×経過日数」を保持指標として記録
- 同一知識を別形式で再出題する問題プールを持つ(穴埋め→短答→応用問題)。形式不一致でも転移することが実証済み
3. 分散学習(spacing)と「間隔×検索」= successive relearning
エビデンス強度: ◎(100年分の研究、メタ分析多数)
主要文献:
- Cepeda, Pashler, Vul, Wixted & Rohrer (2006) Psych. Bulletin 132(3)(PMID: 16719566): 839評価・317実験のレビュー。最適な学習間隔は保持期間が長いほど長くなる
- Cepeda et al. (2008) Psychological Science(PMID: 19076480): 1,350人超の実験。最適間隔はテストまでの期間の約10〜20%(1週間後のテストなら20〜40%=約1〜3日、1年後なら5〜10%=約3週間〜1ヶ月)。間隔は長すぎても逆U字で性能低下するが、短すぎる方が損失が大きい
- Latimier, Peyre & Ramus (2021) Educ. Psych. Review 33, 959–987 DOI: 10.1007/s10648-020-09572-8(プレプリント全文で数値確認): 間隔をあけた検索練習 vs 集中検索練習で g=1.01 [0.68, 1.34](39効果、出版バイアス補正後 g=0.74 [0.55, 0.91]、trim-and-fill後49効果)
拡張間隔 vs 均等間隔の現在の見解: Latimier et al. (2021) が54効果を統合した結果、拡張スケジュールと均等スケジュールの差は g=0.034(95%CI [-0.10, 0.17], SE=0.06)で有意差なし。「1日→3日→7日→…」と広げても「3日おき固定」でも大差ない。重要なのはスケジュールの形状ではなく、間隔をあけること自体と総反復回数。Carpenter et al. (2022) も同見解。
successive relearning(連続的再学習): 検索練習×分散の組み合わせ。「初回セッションで基準(例: 3回連続正答)まで検索練習→数日後にまた基準まで再学習→を複数回」
- Rawson & Dunlosky (2022) Current Directions in Psychological Science, 31(4), 362–368 DOI: 10.1177/09637214221100484
- 教室実装: Rawson, Dunlosky & Sciartelli (2013) Educ. Psych. Review(DOI: 10.1007/s10648-013-9240-4)で試験成績が向上(レビュー解説では「約10%=約1段階の成績向上」とされる)。Janes et al. (2020)、Higham et al. (2021, 2022 J. Educational Psychology: 学期末の再生成績向上に加え、メタ認知・習得感の改善と不安の低減を報告)
- 留保: 応用研究はまだ13本程度で大半が大学生対象。数学の問題解決ではベネフィットが小さかったという報告あり(事実・定義型の知識で最も有効)
教材への実装案:
- 復習キュー機能を教材サイトに内蔵: 各クイズ項目に次回復習日を持たせ、トップページに「今日の復習」を表示
- successive relearning モード: 達成した項目だけ次回セッションへ送り、セッション跨ぎの正答回数をバッジ表示
- 章末に「前章までの混ぜ込み復習クイズ」(累積復習)
4. インターリービング(interleaving)
エビデンス強度: ○(メタ分析で中程度、ただし領域依存性が強い)
主要文献: Brunmair & Richter (2019) "Similarity matters" Psych. Bulletin, 145(11), 1029–1052 DOI: 10.1037/bul0000209。59研究のメタ分析で全体 g=0.42。
効く領域 / 効かない領域(同メタ分析より):
- 絵画・視覚素材の分類学習: g=0.67(最大) / 数学: g=0.34 / 説明文・味覚弁別: 有意でない / 単語(語彙)学習: g=−0.39 でブロック学習の方が良い
- 効く条件: カテゴリ間の類似性が高く弁別が難しい素材・複雑な内容。メカニズムは「カテゴリ間の対比・弁別学習」
教室での実証: Rohrer, Dedrick, Hartwig & Cheung (2020) J. Educational Psychology, 112(1), 40–52(全文PDFで確認)。中1数学54クラスのRCTで、1ヶ月後の抜き打ちテストが混合練習61% vs ブロック練習38%、d=0.83。
教材への実装案: 混同しやすい概念ペアの対比クイズ(「AとBどちらか」形式)。累積混合ドリル。UI に「バラバラに出るのは仕様」の理由明示(主観的難度で離脱させない)。語彙・用語カードは無理にシャッフルしない。
5. 望ましい困難(desirable difficulties, Bjork)
エビデンス強度: ○(枠組みとしては各効果に支えられるが、「困難なら何でも良い」わけではない)
主要文献: Bjork & Bjork (2020) JARMAC, 9(4), 475–479(PDF)。概念の初出は Bjork (1994)。中核例=検索練習・分散・インターリービング・文脈の変動。
反証条件: Chen, Castro-Alonso, Paas & Sweller (2018) Frontiers in Psychology DOI: 10.3389/fpsyg.2018.01483 — 要素間相互作用が高い(複雑な)教材では、テスト効果・生成効果が消失・逆転しうる(ワーキングメモリ過負荷)。
誤解されやすい点:
- 「学習中のパフォーマンス低下・困難感 = 悪い学習」ではない(学習と成績の区別)。逆に「スラスラ進む=良い学習」でもない
- 困難は前提知識で乗り越えられる場合のみ望ましい。装備がない学習者には undesirable になる
- 初学者×複雑教材では worked example が生成より優る — 熟達に応じて足場を外す(expertise reversal)
教材への実装案: 「例示→穴埋め→自由再生」のフェーディング系列。主要メトリクスは学習中の成績でなく遅延テストの成績。
6. 精緻化質問・自己説明・生成効果
6a. 精緻化質問(elaborative interrogation)
- エビデンス強度: △〜○。Dunlosky et al. (2013) で中程度。Donoghue & Hattie (2021) では d=0.56(254効果)。前提知識があるほど有効
- 実装案: 本文の要所に「なぜ□□は△△になるのか?」の自由記述→模範説明を表示して自己採点
6b. 自己説明(self-explanation, Chi)
- エビデンス強度: ○。Bisra, Liu, Nesbit, Salimi & Winne (2018) Educ. Psych. Review, 30, 703–725 DOI: 10.1007/s10648-018-9434-x — 64報告・69効果・5,917人で g=0.55。プロンプト誘導でも有効、「与える」より「生成させる」が良い。古典: Chi, De Leeuw, Chiu & LaVancher (1994) Cognitive Science
- 実装案: worked example の各ステップに「このステップはなぜ必要?」の折りたたみプロンプト。「この行を消すと何が起きる?」
6c. 生成効果(generation effect)
- エビデンス強度: ○。Bertsch, Pesta, Wiscott & McDaniel (2007) Memory & Cognition, 35(2), 201–210(PMID: 17645161)— 86研究・445効果で d=0.40。複雑教材では消失・逆転しうる(Chen et al. 2018)
- 実装案: 重要語をクリック開示の穴埋め本文に。「続きを予想してから開く」。コード例は先に自分で書かせてから模範解答
7. メタ認知の錯覚(fluency illusion・較正)
エビデンス強度: ◎(現象自体は頑健に再現)
- 再読の流暢性錯覚: Roediger & Karpicke (2006) — 再読群は自信が高いのに1週間後の成績は低い
- 能力の錯覚: Koriat & Bjork (2005) JEP: LMC(PMID: 15755238)— 学習時は答えが目の前にあるため想起可能性を過大評価(foresight bias)。改善策はテスト条件の体験(Koriat & Bjork 2006, PMID: 17128596)
- 知覚的流暢性: Rhodes & Castel (2008) JEP: General(PMID: 18999356)— 大きいフォントの語は「覚えられる」と判断されるが実際の記憶は変わらない
- 戦略選好の錯覚: Kornell & Bjork (2008) Psychological Science, 19(6), 585–592 — 分散提示が圧勝(d=0.99〜1.28)したのに、78%が「ブロックの方が同等以上」と回答。テスト直後でも錯覚が残る
- 総説: Carpenter, Pan & Butler (2022) が「効果的方略が使われない原因は、努力感と学習の取り違え」と整理
教材への実装案:
- 確信度付きクイズ: 回答時に自信(低/中/高)を選ばせ、較正チャート(自信×正答率)を表示。「高確信×不正解」を強調して再学習キューへ
- 予測→実測フィードバック: セッション開始時の予測と実績の差分を表示
- 「読了」を成果として扱わない: 進捗はクイズ通過ベース
- 教材内で錯覚の存在自体を教える(メタ認知教育)
8. エビデンスが弱い・俗説と明記すべきもの
| 主張 | 実際 | 出典 |
|---|---|---|
| 学習スタイル適合 | 「神話」。meshing の証拠は事実上皆無。教育者の89.1%(15,045人・18ヶ国)が信じている。直接検証の効果量 d=0.04 | Pashler et al. (2008) PSPI; Newton & Salvi (2020); 2025年整理 |
| ハイライト・下線引き | 単独では低有用性。選別的に引いて検索練習の素材にするなら害減 | Dunlosky et al. 2013; Miyatsu et al. 2018 |
| 再読 | 1週間後にはテスト練習に劣り、自信だけが残る | Roediger & Karpicke 2006 |
| 要約 | 訓練なしでは低有用性 | Dunlosky et al. 2013 |
| 「拡張間隔が均等間隔より優れる」 | 俗説寄り。メタ分析で差なし(g=0.034, n.s.) | Latimier et al. 2021 |
| 「フィードバックなしでも十分」 | 教室データでは有が明確に優位(g=0.537 vs 0.374) | Yang et al. 2021 |
| 「インターリービングは万能」 | 語彙学習では逆効果(g=−0.39) | Brunmair & Richter 2019 |
| 「努力感があれば良い学習」 | 誤読。前提知識がない・複雑すぎる場合は undesirable に転じる | Bjork & Bjork 2020; Chen et al. 2018 |
9. 統合: 実装優先度
①検索練習(フィードバック付き)→ ②分散復習スケジューラ → ③確信度・較正トラッカー → ④混合演習(判別系のみ)→ ⑤自己説明プロンプト の順に実装価値が高い。
- データモデルの核: 進捗=「項目ごとの遅延テスト成績」。読了フラグは飾り
- 章のライフサイクル: プレクイズ(1–2問)→ 本文 → 章末クイズ(即時解説付き)→ 数日後に復習キュー → 均等間隔 → 3セッション連続クリアで「習得」
- コピー文言もエビデンスベース: 「難しく感じるのは正常(望ましい困難)」「再読より1回のセルフテスト」
未確認事項
(1) McCurdy et al. (2020) の生成制約別の具体的効果量、(2) Higham et al. (2022) の正確なDOI、(3) Pressley et al. (1987)・Chi et al. (1994) の原文(二次文献経由で確認)、(4) successive relearning の「約1成績段階の向上」はレビュー解説記事経由の数値。