動画で話したこと
動画で扱ったのは、ここまででした。2026年に Nature Communications に出た論文が、アメリカの7つの国立公園で動いていた11の予約の仕組みについて、2021年から2024年の予約1件ごとの記録、およそ528万件を調べました。売り出しの最初の5分で埋まった枠の割合を「競争の激しさ」と呼び、競争が激しい枠で予約を取れた人ほど、住む郵便番号の世帯所得の中央値が高い、という関連が見えました。当日に予約した人と比べて、いちばん競争が激しかった事前の枠では3748ドルから4135ドル、いちばん競争が激しかった直前の枠では2690ドルから3204ドル高い、という数字です。
ただし測ったのは、その人の所得ではありません。住んでいる郵便番号の、世帯所得の中央値です。著者自身が「生態学的誤謬」(地域の数字を、そこに住む一人ひとりに当てはめてしまう誤り)という名前を出して注意しています。
ここから先が、この記事の役目です。動画では一言で済ませたところを、論文の本文に戻って開いていきます。
この記事で使う数字と事実は、この論文の本文に書かれていることだけです。補足資料(Supplementary)は手元にないので、そこにしかない数字は扱いません。本文が「補足の表にある」と案内しているところは、そう書きます。記事のほうで補った読みや推測には、そのつど印を付けます。
この記事には図を入れていません。この論文の本文には、推定の幅(信頼区間)の数値が1つも載っていないからです。理由は下の「幅は、信頼区間ではありません」で詳しく書きます。
この研究には、参加者も割り付けもありません
研究デザインから確かめます。医学の論文なら、ここで「誰を、どう分けて、いつ測ったか」を書きます。この研究には、その「どう分けて」がありません。
参加者を募って同意をもらった研究ではありません。公園にくじ引きで仕組みを割り当てた実験でもありません。すでに残っている予約の記録と、国が毎年行う大規模な世帯調査(American Community Survey、ACS)の所得の統計を突き合わせて数えた、観察研究です。
ですから、「割り付けどおりに比べたのか、実際に受けたかどうかで比べたのか」という区別も、ここでは生じません。この研究の比較は、すべて「実際にどの枠で予約が成立したか」で分けたものです。誰かがある枠を割り当てられた、という記録はありません。
著者は、今後の課題として実験に触れています。公園が枠の配り方を変えながら、競争と利用者の所得を追いかける実験ができれば、こうした関係を突き止めるのにとても役立つだろう、というのが本文の言い方です。そして、そうした実験がいつでもできるとは限らない、とも書いています。駐車場の容量が限られているため、アカディアとハレアカラの日の出の枠は、事前でも直前でもとても競争が激しい、というのがその例です。ほかの公園には、枠の数を試してみる余地がもっとあるかもしれない、とも書かれています。ここで言う実験は、公園が枠の数を計画的に動かして、競争と利用者の所得を同時に追いかけるものです。あとで出てくるヨセミテの受付期間の変更は、公園が運用を変えたものを著者があとから分析に使ったもので、この意味の実験ではありません。なお、この意味の実験がすでに行われた、あるいはまだ行われていない、という記述は本文にありません。
何を集めたか
データは3つの出どころからきています。
- 予約の記録。Recreation Information Database(RIDB)の、取引1件ごとのデータです。取引の日付と時刻が正確に記録されています。期間は2021年から2024年まで。新型コロナのあと、予約制が動き出した最初の年から、データが取れる直近の年までです。
- 所得。American Community Survey(ACS)の、郵便番号ごとの世帯所得の中央値です。予約した人が RIDB に申告した郵便番号に、この中央値を当てはめています。
- 仕組みの設計。各公園の Recreation.gov の商品ページから、予約制の設計を年ごとに集めました。過去の年のページは Internet Archive の Wayback Machine で見ています。
対象は、2021年から2024年に「一般の」予約制を動かしていた7つの国立公園の、11の予約の仕組みです。公園の名前は、アカディア、アーチーズ、グレイシャー、ハレアカラ、マウントレーニア、ロッキーマウンテン、ヨセミテ。本文は、この7つがこの期間に動いていた一般の予約制のすべてだと書いています。
「一般の」というのは、特定の活動に限らない、という意味です。ハイキング、車での周遊、野生動物を見ることなどをひとまとめに含みます。予約の対象は、アカディアのカディラック山やロッキーマウンテンのベアレイク・ロード回廊のような特定の場所のこともあれば、アーチーズやヨセミテのように公園の広い範囲のこともあります。時間帯が決まっているもの(アカディアやハレアカラの日の出、ロッキーマウンテンの1時間ごとの入園枠)もあります。
誰を、何を除いたか
2種類の除外があります。ここは、結果の読み方に効きます。
1つめ。技術のいる活動の予約を除いています。シェナンドー国立公園のオールドラグ、ザイオン国立公園のエンジェルスランディング、ザ・サブウェイ、ザ・ナローズの4つです。本文の言い方は「高度な技術や専門的な技能を要する活動」です。この2つの公園は、7つの中に入っていません。
2つめ。海外からの来訪者を除いています。生の標本のおよそ2パーセントにあたります。理由も本文に書かれていて、その人たちの所得が分からないからです。アメリカの郵便番号がなければ、ACS の所得を当てられません。
この2つめは、結果を読むときに覚えておく価値があります。この論文が扱っているのは、アメリカ国内から予約した人どうしの比較です。海外から来る人が、事前に予約する傾向が強いのか弱いのか、競争の激しい枠を取れているのかどうかは、この分析からは分かりません。
なお、公園から50マイル以内に住む人(ゲートウェイ)と、それより遠くに住む人(トラベラーズ)の郵便番号の平均所得については、補足の表で扱われていると本文に案内があります。本文は、遠くから来る人はかなり均質で所得の高い地域に住んでいる一方、ゲートウェイの側は所得の幅が広い、と書き、だから結果は幅広い公園や周辺地域に一般化しやすいだろう、と述べています。数値は補足の表にあり、本文にはありません。
比べた相手は、当日に予約した人です
ここは、この論文を読み違えないための一番の要です。
回帰では、先行き0日の予約、つまり当日に予約した人が「省いた区分」になっています。統計の言い方では基準の区分です。ですから、表に並ぶ競争と先行き期間の数字は、「その区分の人の郵便番号の所得の中央値が、当日に予約した人の郵便番号の所得の中央値より、何ドル高いか(低いか)」を表します。
本文はこの点をていねいに書いています。当日の予約が、事前の売り出しと直前の売り出しの両方の基準であり、同時に、季節のあいだのほかの時期の予約を表す先行き期間の区分の基準でもある、という言い方です。もう1つの書き方として、比較は、ある区分と、その日のうちに入れるだけの空きがあるときに行われた予約とのあいだで行われる、とも書かれています。
ただし、表のすべての行がこの形ではありません。表には、出発日が連邦の祝日かどうか、出発日が週末かどうかを表す行もあります。これは「その出発日が祝日(週末)だったか、そうでなかったか」の比較で、当日に予約した人との比較ではありません。この2つの行は、下の「祝日と週末」の節で別に扱います。
比べた相手は、予約を取ろうとして取れなかった人ではありません。この違いは大きいところです。「高所得の人が枠を取り、低所得の人が締め出された」という形の比較は、この論文にはありません。あるのは、成立した予約どうしの比較です。予約を試みて取れなかった人がどうだったかは、この論文の本文には出てきません。
「競争の激しさ」は、枠の割合です
競争の激しさは、次のように定義されています。ある出発日(またはブロック)に割り当てられた枠の総数のうち、予約の受付が始まってから最初の5分間で予約された枠の割合です。
大事なのは、これが枠の割合であって、人の割合でも、申し込みの数でもないことです。「何人が申し込んで何人が外れたか」ではありません。用意された枠が、どれだけ早く消えたか、です。
この割合を4つの段階に分けています。0から25パーセント、25から50パーセント、50から75パーセント、75から100パーセントです。事前の枠と直前の枠で、それぞれ別に作ってあります。
細かいところですが、いちばん下の段は0ちょうどを含みません。本文の区切りの書き方が、0を含まない形になっています。売り出しの最初の5分で1枠も埋まらなかった場合は、この4段階のどれにも入りません。
取引をどう分類したかも本文にあります。売り出し日に行われた取引を「事前」または「直前」の予約と分類し、そのうえで、売り出し開始から最初の5分のあいだに買われたかどうかを記録しています。
「直前の枠」と書く理由
この記事では「前日」という言葉を使いません。論文の day-ahead は、公園によって中身が違うからです。
本文の文章が挙げているのは、多くが1日前で、アカディアとハレアカラが2日前、ヨセミテが7日前、というものです。ただし、同じところに置かれた Table 1A を見ると、2024年に予約制を始めたマウントレーニアの2つの枠(サンライズとパラダイス)も2日前になっています。ですから「前日の枠」と書くと、事実と合いません。この記事では「直前に売り出す枠」と書きます。
事前の枠にも2つの形があります。ブロック型は、ある期間の全日程が一斉に売り出されるものです(たとえば7月の全日が3月1日に一斉に出る)。ローリング型は、毎日、決まった日数先の1日分だけが出るものです(たとえば90日後の1日分)。
事前の受付期間について、本文の文章は30日から120日のあいだだと書いています。公園によっても、同じ公園の年によっても違う、とも書かれています。ただし、同じところの Table 1A には、この範囲を超える設定も載っています。ヨセミテの2024年は90日から240日、グレイシャーのゴーイング・トゥ・ザ・サン・ロードの2023年は120日から150日です。本文の文章と表が食い違っているので、この記事では両方を書いておきます。
回帰は、5通り組まれています
本文の回帰式は、郵便番号の所得の中央値を、3つのまとまりで説明する形になっています。事前の枠の競争の段階、直前の枠の競争の段階、そして先行き期間(出発日の何日前に予約したか)です。先行き期間は、出発日から注文日を引いて計算されています。区分は6つで、0から30日、30から60日、60から90日、90から120日、120から180日、180日以上です。
そこに2種類の「差し引き」が入ります。1つは、許可ごとの平均の違いを差し引くもの。同じ公園でも複数の入園枠があるところ(たとえばロッキーマウンテンのベアレイク・ロードと、それ以外)は別々に扱われています。もう1つは、時期による需要の違いを差し引くものです。
表の5つの列は、この差し引きの入れ方が違います。
- 1列目:許可ごとの平均効果だけを入れた、いちばん素朴な形
- 2列目:出発日が週末か、連邦の祝日かを足したもの
- 3列目:年の何週目かを足したもの
- 4列目:許可ごとに別々の週の効果を足したもの
- 5列目:先行き期間と所得の関係を、区分に切らずに曲線のまま推定したもの(ロビンソンのセミパラメトリック回帰)
5列目だけは、扱いが違います。計算の都合で、全取引から10パーセントを無作為に抽出した標本を使い、週の効果を入れていません。観測数も違います。1列目から4列目は5,279,457件、5列目は527,512件です。この件数は、予約の取引1件ごとに数えたもので、人の数ではありません。同じ人が何件予約していたかは、本文に書かれていません。
本文は、なぜ5列目を作ったのかも書いています。先行き期間の係数が、区分ごとにまっすぐ並ばなかった(非線形だった)ので、もっと柔軟な形が必要かもしれない、という理由です。
年ごとの変更を分析に使ったのは、ヨセミテだけです
ここは、動画で入れられなかった大事な材料です。
公園ごとに事前予約の期間が違う、というだけでは、期間の効果と公園そのものの性格を切り分けられません。本文もそう書いています。事前予約の期間は需要の違いを映しているかもしれないし、この時期のあいだはあまり変わらないので、期間の効果と、利用者の所得と関係しそうな公園の特徴とを分けるのが難しい、と。
ところがヨセミテは、事前予約の開始時期を年ごとに大きく変えていました。著者は、その変化を分析に使っています。
- 2021年:出発日のおよそ30日から60日前に、5回に分けてブロックを売り出した
- 2022年:分割をやめ、3月23日に1回のブロックにまとめた。出発日によって60日から120日前になる
- 2024年:そのブロックを3か月前倒しして1月5日にした。90日から240日前になる
Table 1A では、ヨセミテの2023年の欄が空になっています。上の並びに2023年がないのはそのためだ、と読みました。この結びつけはこの記事のもので、本文がそう書いているわけではありません。
なお、事前の受付期間が年ごとに変わった公園は、ヨセミテだけではありません。Table 1A では、グレイシャーのゴーイング・トゥ・ザ・サン・ロードも年ごとに変わっています。ヨセミテだけなのは、その年ごとの違いを回帰の材料として使ったという点です。
本文は、ヨセミテの変更によって「実際の先行き期間」が動いたと書いています。実際の先行き期間というのは、事前の枠が売り切れた日から出発日までの長さのことです。7月4日の予約の埋まり方を2021年、2022年、2024年で並べた図では、曲線が平らになるところ(=事前の枠が売り切れた時点)が、2021年の5月末から2024年の5月初めへと動いています。2022年は、事前の枠に回した割合が大きかったこと(2021年の約50パーセントに対して約70パーセント)が効いて、6月初めになっています。
この年ごとの違いを使った回帰の結果は、補足の表にあると本文が案内しています。本文に書かれている数字は次のとおりです。ヨセミテでは、先行き期間が1日長くなるごとに、郵便番号の所得の中央値が21ドルから24ドル高いほうへ動いていました。そこから、30日を180日に延ばすとおよそ3150ドルから3600ドルの差になる、と本文は書いています。
そして著者は、この結果があることで、事前予約の効果は「好みの違い」だけではなく、締め出しの効果も含んでいるのだろう、と述べています。
この数字は、何を指しているか
数字の中身を開けます。
ドルは、誰のドルでもありません
まず、単位の話です。表に並ぶ「3748ドル」のような数字は、誰かの財布の中身の差ではありません。
比べているのは、郵便番号の世帯所得の中央値どうしです。ある区分で予約した人たちが住んでいる郵便番号の、世帯所得の中央値の平均。それと、当日に予約した人たちが住んでいる郵便番号の、世帯所得の中央値の平均。その差です。
正確には、素の平均の引き算ではありません。上で見たとおり、許可ごとの平均の違いや、時期による需要の違いを差し引いたうえでの差です。何を差し引いたかは、列によって違います。
ですから、「競争の激しい枠を取った人の年収が、当日に予約した人より3748ドル高かった」とは読めません。読めるのは、「競争の激しい枠を取った人が住んでいた地域は、当日に予約した人が住んでいた地域より、世帯所得の中央値が3748ドル高い地域だった」までです。
この2つは、似ているようで別のことです。この記事の後半で、なぜ別のことなのかを、著者の言葉で見ていきます。
幅は、信頼区間ではありません
「3748ドルから4135ドル」という書き方を見ると、統計に慣れている人ほど信頼区間だと思います。違います。
この幅は、モデルの組み方を変えたときの、推定値のいちばん小さい値といちばん大きい値です。上で見た1列目から4列目の、同じ行に並ぶ4つの数字の最小と最大にあたります(この対応づけは、表の数字と本文の書き方を突き合わせた、この記事の読みです)。
この論文の本文に、信頼区間は1つも出てきません。Table 2 に載っているのは、係数と、かっこの中の標準誤差と、印だけです。印は、アスタリスク1つが p 値0.10未満、2つが0.05未満、3つが0.01未満を表します。標準誤差は、許可×年の単位でクラスターをとってあります。同じ許可の同じ年の中では、誤差が似た動きをすることを見込んだ計算です。
2つの幅の違いを、はっきり分けておきます。
- 信頼区間:同じやり方でデータを取り直したときに、推定値がどれくらいばらつくかの幅です。標本のばらつきの話です。
- モデルの組み方の幅:分析する人が、何を差し引くかを変えたときに、推定値がどれくらい動くかの幅です。分析の選び方の話です。
どちらも「幅」と呼ばれますが、答えている問いが違います。モデルの組み方の幅がせまいことは、「この結論は、差し引く要因の選び方をある程度変えても動かなかった」という意味です。「この推定が正確だ」という意味ではありません。
この記事に図がないのは、ここに理由があります。この連載の図のうち、幅を見せるもの(interval)は、差がない位置に線を引き、幅がその線をまたぐかどうかを見せる作りになっています。信頼区間ではない幅をその図に入れると、部品が自動で付ける「幅は0をまたいでいる/いない」という表示が、そのまま統計的な判定として読まれてしまいます。ですから、この回では図を作らず、言葉で説明しています。
パーセントの言い方は、別の幅から来ています
本文には、ドルとは別に、パーセントでの言い方も出てきます。ここは混ぜやすいところなので、出どころを分けて書きます。
論文の考察の部分には、こう書かれています。いちばん競争が激しい事前の売り出しでは、予約を取れた人は世帯所得の中央値が3200ドルから4200ドル(4から5パーセント)高い郵便番号に住んでいた。いちばん競争が激しい直前の売り出しでは、2700ドルから5000ドル(3から6パーセント)高い郵便番号だった、と。
この3200ドルから4200ドル、2700ドルから5000ドルという幅は、上で見た3748ドルから4135ドル、2690ドルから3204ドルとは違う幅です。5列目の推定(10パーセント抽出のセミパラメトリック推定)を含めると、事前の枠は3158.8ドルから4135.1ドルまで、直前の枠は2690.4ドルから5029.8ドルまで広がります。考察の幅は、この5通りをまとめた言い方だと読めます(この対応づけは、この記事の読みです)。
ここで大事なのは、貼り合わせないことです。「3748ドルから4135ドル(4から5パーセント)」という書き方は、この論文の本文にも、考察にも、要旨にもありません。4から5パーセントは、5列目を含めた幅に付いたパーセントだと読めます。ドルの幅とパーセントの幅を、それぞれ別の列の組み合わせから取ってきて並べると、論文が書いていない数字ができあがります。
さらに、要旨の言い方はまた少し違います。要旨では、いちばん競争が激しい直前と事前の売り出しについて、世帯所得の中央値が3から5パーセント高い郵便番号、と1つにまとめられています。事前の予約期間を6か月に延ばすと、5パーセント高い郵便番号の人へ予約が移る、とも書かれています。
同じ結果が、本文では2つのドルの幅、考察では2つのパーセントの幅、要旨では1つのパーセントの幅として書かれている。これは論文としておかしなことではありません。場所が後ろに行くほど、短く詰めた表現になります。ただし、短くなるだけではありません。要旨の上端は5パーセントで、考察の上端(直前の売り出しの6パーセント)より低くなっています。幅そのものがせまくなっています。読む側は、どこから取った数字なのかを意識する必要があります。見出しやニュースが引くのは、たいてい一番短く詰めたところです。
パーセントを、自分で計算しないでください
ここで、やってはいけない計算を1つ挙げます。
本文には、グレイシャー国立公園の記述的な図の説明として、予約者の郵便番号の所得の平均が7月初めのおよそ8万5000ドルから、枠が追加されたあとに7万5000ドルから8万ドルのあいだに下がった、という記述があります。
この8万5000ドルを土台にして、4000ドルを割り算してはいけません。理由は2つあります。
1つめ。この8万5000ドルは、1つの公園の、1つの季節の、1日ごとの平均です。回帰の基準になっている「当日に予約した人の所得の水準」ではありません。回帰の基準となる水準は、本文に書かれていません。
2つめ。そもそも、これは郵便番号の所得の中央値を予約日ごとに平均した値です。7つの公園の4年分をまとめた回帰の推定値とは、まとめている範囲が違います。片方は1つの公園の1つの季節の1日ごと、もう片方は7つの公園の4年分をまとめたものです。
本文は、補足の表に、公園の近くに住む人と遠くに住む人の平均所得が載っていると案内しています。ただし、著者が考察のパーセントをどうやって出したのかは、本文に書かれていません。手元にその水準がない以上、この記事ではドルの数字と、論文自身が書いたパーセントの数字を、それぞれ別々に示すだけにします。
結果を、順に見る
ここからは、まず本文と Table 2 にある回帰の数字を並べます。Table 2 の競争と先行き期間の数字は、すべて当日に予約した人の郵便番号との比較です。節の後半では、回帰ではない、図から読んだ数字も扱います。そこは比べ方が違うので、そのつど断ります。
事前の枠:競争が激しいほど、差が大きい
事前の枠の競争の4段階について、1列目から4列目の推定値は次のようになっています。
- 最初の5分で0から25パーセントが埋まった枠:520.4ドル、519.7ドル、479.2ドル、343.4ドル。本文の言い方は「343ドルから520ドル高い」です。前の2つには、p 値0.10未満の印が付いています。
- 25から50パーセント:730.2ドル、693.4ドル、403.8ドル、115.6ドル。この4つには、有意を示す印が1つも付いていません。差し引く要因を足していくほど、値が小さくなっています。
- 50から75パーセント:2614.8ドル、2529.8ドル、2506.1ドル、1814.8ドル。4つとも p 値0.01未満の印が付いています。
- 75から100パーセント:4135.1ドル、3968.8ドル、4047.7ドル、3747.7ドル。これが動画で出した3748ドルから4135ドルです。4つとも p 値0.01未満の印が付いています。
4段階を上から下に眺めると、競争が激しい段ほど値が大きくなる向きが見えます。ただし、4段とも順に大きくなっているのは1列目と2列目だけです。3列目では479.2ドルと403.8ドル、4列目では343.4ドルと115.6ドルで、競争が弱いほうの2段の順が入れ替わっています。本文の要約は、事前でも直前でも、競争が激しいほど平均所得が高いことと関連していた、というものです。
5列目(10パーセント抽出のセミパラメトリック推定)は、595.2ドル、1069.0ドル、1976.2ドル、3158.8ドルです。こちらは4つとも有意を示す印が付いています(上の3つが p 値0.05未満、いちばん下が0.01未満)。本文は、5列目の競争の推定値は1列目から4列目と同程度だ、と書いています。
直前の枠:向きは同じでした
直前の枠で、いちばん競争が激しい段(75から100パーセント)の推定値は、3203.8ドル、2815.2ドル、2771.2ドル、2690.4ドルです。本文は、これを2690ドルから3204ドル高い、とまとめています。5列目は5029.8ドルで、本文はこの値を、いちばん競争が激しい直前の売り出しは5030ドル高い所得の中央値と関連していた、と別に書いています。事前の枠の5列目についても同じように、3159ドル高い郵便番号だったと書かれています。
ここで1つ、お断りがあります。本文から取り出した Table 2 では、直前の枠の中段の行の見出しが壊れていて、「75から100パーセント」という同じ見出しが2回続いています。
どちらが75から100パーセントの行なのかは、本文の記述から分かります。本文が「いちばん競争が激しい直前の売り出しは2690ドルから3204ドル高い」「5列目では5030ドル」と書いているので、3203.8ドルから2690.4ドルが並び、5列目が5029.8ドルの行がそれにあたります。残ったもう1つの行が50から75パーセントのはずですが、見出しが壊れている以上、この記事ではその行の数字を使いません。使っているのは、いちばん競争が激しい段(75から100パーセント)と、競争が弱いほうの2つの段だけです。
競争が弱いほうの2つの段は、こうなっています。0から25パーセントの行は、1列目から4列目がマイナス351.0ドル、マイナス271.9ドル、マイナス197.7ドル、マイナス120.8ドルで、印は付いていません。25から50パーセントの行は、54.57ドル、36.37ドル、59.43ドル、マイナス73.73ドルで、こちらも印は付いていません。つまり、直前の枠では、競争が弱い段で当日予約との差がはっきりしませんでした。
ただし5列目だけは違う顔をしています。0から25パーセントで1866.5ドル、25から50パーセントで2279.2ドルと、どちらも p 値0.01未満の印が付いています。5列目は10パーセント抽出で、週の効果を入れていない推定です。同じ行でも、組み方によってここまで違うことがある、という例として見ておく価値があります。
どれくらい前に予約したか
競争とは別に、先行き期間そのものの推定値も出ています。1列目から4列目です。
- 0から30日前:3702.0ドル、3631.8ドル、3456.8ドル、3313.2ドル
- 30から60日前:3641.6ドル、3533.6ドル、3333.4ドル、3254.3ドル
- 60から90日前:3830.1ドル、3722.9ドル、3378.4ドル、3256.4ドル
- 90から120日前:2586.0ドル、2480.7ドル、2455.1ドル、2466.2ドル
- 120から180日前:2022.3ドル、1922.1ドル、1707.3ドル、1614.7ドル
- 180日以上前:2098.5ドル、1880.5ドル、1681.1ドル、2060.3ドル
本文はこれを、30日まで、30から60日、60から90日はまとめて3254ドルから3830ドル高い、もっと先の予約は差がやや小さく、90から120日は2455ドルから2586ドル、120から180日は1615ドルから2022ドル、180日を超えると1681ドルから2099ドル、と要約しています。
ここで目に付くのは、区分が先に行くほど値がまっすぐ増えるわけではない、ということです。どこが一番大きいかは、列によって違います。1列目と2列目では60から90日が一番大きく、3列目と4列目では0から30日が一番大きくなっています。どの列でも、90日を超えるあたりから値は小さくなります。ただし1列目と4列目では、180日以上の区分が、120から180日の区分より大きくなっています。本文もこの非線形性を指摘して、だからもっと柔軟な形(5列目)が必要かもしれない、と書いています。
180日前の「約1万ドル」は、表の数字ではありません
動画で落とした数字がこれです。本文にはこう書かれています。180日前に予約する人は、当日に予約する人と比べて、世帯所得の中央値がおよそ1万ドル高い郵便番号から来ている、ほかの条件が同じなら。
この1万ドルは、上の表の「180日以上前:1681ドルから2099ドル」とは別の数字です。本文は、この文を Fig. 4 の説明として書いています。Fig. 4 は、先行き期間と所得の関係を、区分に切らずに曲線のまま推定したものです。図の説明には、ロビンソンのセミパラメトリック回帰で、10パーセント抽出のデータを使い、許可ごとの平均効果を入れている、と書かれています。
同じ「180日」でも、表の区分の係数と、曲線の上の1点とでは、数字が違います。どちらかが間違いだ、という話ではありません。片方は「180日以上をひとまとめにした区分の平均的な差」、もう片方は「曲線を180日のところで読んだ値」です。この記事でそう区別して読んでいます。この読み分けの説明は、この記事のもので、論文にこう書かれているわけではありません。
ですから、この1万ドルを引くときは、「Fig. 4 の曲線から読んだ値」と添える必要があります。表の数字と並べて「180日で1万ドルの差」と書くと、表を見た人が数字を見つけられません。
祝日と週末
表には、競争や先行き期間とは別に、2つの行があります。上で書いたとおり、この2つは当日に予約した人との比較ではありません。出発日が祝日だったか、週末だったか、という比較です。
- 出発日が連邦の祝日:1952.8ドル、1722.0ドル、1655.2ドル、1621.5ドル
- 出発日が週末(土曜か日曜):1520.5ドル、1539.8ドル、1527.7ドル、1506.3ドル
どちらも4列とも p 値0.01未満の印が付いています。本文も、祝日や週末にあたる枠は、どの場合も所得が高いことと関連していた、と書いています。
そして本文は、そのすぐあとに大事なことを書いています。祝日、週末、季節の効果を差し引くと、競争が所得に及ぼす推定値は小さくなる。だから、需要に関わる要因を差し引くことが重要だ、と。これは、表の1列目から4列目に向かって、値がおおむね小さくなっていく理由の説明でもあります。
ただし、すべての行でまっすぐ小さくなるわけではありません。たとえば事前の枠のいちばん競争が激しい段は、4135.1ドル、3968.8ドル、4047.7ドル、3747.7ドルで、3列目が2列目より大きくなっています。
枠を増やしたら、所得が下がった日
これも動画では出せなかった材料です。ただし、性質が違うので、先に断っておきます。ここから書くのは、回帰の結果ではありません。日ごとの動きを絵にした、記述的な図の説明です。
ロッキーマウンテン国立公園では、2021年の季節に、予約を取った人のおよそ3分の1が来なかった(ノーショー)ことに管理者が気づきました。枠が余っていたということです。そこで2021年7月1日に、ベアレイク・ロードの枠を1日600から1200へ増やしました。
そのあと、競争の指標はおよそ85パーセントからおよそ70パーセントに下がりました。そして、春のあいだ上がり続けていた所得は、この変化のあとに下がり、予約を取った人が住む郵便番号の所得の中央値が、およそ2000ドル低くなりました。
グレイシャー国立公園でも、似た形が書かれています。道路が全線開通して枠が追加された日を境に、競争はおよそ90パーセントからおよそ70パーセントに落ちました。そして、予約を取った人の郵便番号の所得の中央値を予約日ごとに平均した値が、およそ8万5000ドルから、7万5000ドルから8万ドルのあいだに下がりました。
この2つは、回帰の推定ではありません。日ごとの数字を並べた図から読み取れる動きです。差し引きも、ほかの要因の調整も入っていません。ですから「枠を倍にすれば所得が2000ドル下がる」という読み方はできません。本文がここで示しているのは、管理者が決める枠の数が、競争の水準を決めうる、という筋道です。
なお、グレイシャーの図については、本文の中で年の書き方が食い違っています。同じ段落の中で、図が2022年の季節のものだと書かれている一方、道路の全線開通が2021年7月13日に起きたとも書かれています。この記事では、グレイシャーの図の年を特定しません。
競争の水準そのもの
競争がどれくらい激しいのかも、本文に書かれています。下に並べる数字は、Fig. 2 が取り上げている2つの仕組み(ロッキーマウンテンのベアレイク・ロードと、アカディアのカディラック山の日の出)についてのものです。公園全体をまとめた数字ではありません。
- ロッキーマウンテンの事前の枠:2021年と2022年は、最初の5分で埋まるのが枠のおよそ5パーセント。2023年と2024年は10から20パーセント
- ロッキーマウンテンの直前の枠:2023年と2024年は60から80パーセント
- アカディアの事前の枠:2021年のおよそ10から20パーセントから、2024年には6割を超える日が多くなった
- アカディアの直前の枠:9割を超える枠が最初の5分で埋まる
枠の数も本文にあります。アカディアのカディラック山の日の出の枠は、1日およそ150で、毎年ほぼ一定です。これはその仕組みで1日に用意される枠の総数で、そのうち直前に売り出される分がいくつかは、本文に書かれていません。ロッキーマウンテンの上限は、2021年の季節の初めのおよそ1000から、およそ1500、およそ2000へと上がり、2023年と2024年には3000弱になっています。ほかの公園についても、直前の枠で同じように激しい競争の時期があった、と本文は書いています。数字は補足の図にあります。
この研究では言えないこと
動画では1つだけ挙げました。ここでは、著者自身が本文に書いている留保も含めて広げます。この論文には「Limitations」という独立した節がありません。以下は、本文のあちこちに置かれた留保を集めたものです。
1. 地域の数字を、一人ひとりに当てはめられません
これがこの論文の一番大きな限界で、著者が自分で名前を出しています。
本文の言い方はこうです。郵便番号の所得への推定された効果を、個人への効果として解釈したくなるが、その言い方は「生態学的誤謬」のために誤解を招くだろう、と。
なぜ誤解を招くのか。本文は2つの理由を挙げています。集計することで、郵便番号そのものの選ばれ方の偏りが入ること。それと、個人ごとに効果の大きさが違うときに、郵便番号の中での並び替えから生じる偏りが入ることです。
言い換えると、こういうことです。ある郵便番号の世帯所得の中央値が8万ドルだとしても、そこに住んでいる一人ひとりの所得は、それよりずっと高い人から、ずっと低い人までばらけています。競争の激しい枠を取ったのが、その郵便番号の中のどのあたりの人なのかは、このデータからは分かりません。
2. 向きは変わらないだろう、というところまで
そのうえで著者は、追加の検討をしています。
Oster の方法(観測できない要因による選ばれ方が、観測できる要因による選ばれ方の何倍にあたるかを考える方法。本文はこの倍率を、比例的な選択のパラメータと呼んでいます)を使い、郵便番号の中の並び替えについて妥当な範囲を置いたとき、集計した効果と、個人ごとの効果の平均とは同じ向きになる、と示しています。本文の言い換えは、所得の高い人ほど、競争の激しい直前や事前の売り出しで予約している可能性が高い、というものです。
この検討の中身も本文に書かれています。郵便番号ごとの所得の分布(ジニ係数)、旅行にかかる費用の代わり(郵便番号の中心から各公園までの距離)、野外活動への好みの代わり(Recreation.gov での1人あたりの購入)を足した回帰と、それらを競争や先行き期間の区分と掛け合わせた回帰の2つです。
推定値をゼロにするために必要な選ばれ方の強さは、この2つで書き方が違います。変数を足した回帰では、どれも1よりずっと大きいか、マイナスでした。掛け合わせを足した回帰では、大きさは総じて小さくなりますが、それでもすべて1という境目を超えるか、マイナスでした。つまり、観測できない要因が、観測できる要因よりずっと強く効くか、逆向きに効かないと、推定された関連は消えない、という読み方です。数値そのものは補足の表にあり、本文にはありません。
ただし、この検討で分かるのは向きだけです。本文もはっきり書いています。集計データから個人ごとの平均的な効果を特定することはできない、と。別の箇所では、集計した郵便番号のデータを使って個人ごとの効果を特定するのは不可能だ、とも書かれています。
ここで、もう1つ数字を出しておきます。この個人の水準の検討に使われた回帰の R²(モデルが説明できたばらつきの割合)は、およそ0.0244から、変数を足して0.0456、さらに掛け合わせを足して0.0503でした。1に近いほど当てはまりがよい指標です。0.05というのは、郵便番号の所得のばらつきのうち、このモデルで説明できたのはごく一部だ、という意味になります。予約の仕組みは、誰がどこに住んでいるかを決める要因のごく一部だ、と読めます。この読み方は、この記事のもので、論文がそう書いているわけではありません。なお、Table 2 のほうの R² は本文に書かれていません。
3. 仕組みの違いは、公園の違いかもしれません
この研究は、公園にくじ引きで仕組みを割り当てた実験ではありません。ですから、仕組みの違いと、公園そのものの違いが混ざりえます。
著者もそう書いています。設計の選び方が、目に見えない需要の好みを映しているかぎり、分析の方法は、所得と相関しうる、公園ごとで時期によって変わる需要の動きを考慮しなければならない、と。だから2列目から4列目で、週末、祝日、季節、公園ごとの季節性を順に差し引いています。
さらに本文は、ヨセミテの節で、公園ごとの事前予約の期間は需要の違いを映しているかもしれず、期間の効果と公園の性格を切り分けるのが難しい、と書いています。だからこそ、同じ公園の中で開始時期が変わったヨセミテを別に調べたわけです。
差し引きは、思いつく要因にしか効きません。思いついていない要因は、そのまま残ります。
4. 著者自身が付けている、公平さの条件
これは見落としやすいところです。
本文は、表と図を読むときの注意として、こう書いています。所得の高い人が事前に予約したがるとしても、その好み自体が公平さに影響するのは、その予約のせいで所得の低い人があとから予約できなくなる場合だけだ、と。そして、事前予約の効果をもっとよく確かめるなら、事前の枠が売り切れた時点の実際の先行き期間に注目するべきだ、とも書いています。
つまり、「所得の高い人が早く予約する傾向がある」ことと、「所得の低い人が締め出されている」ことは、同じではありません。著者は、その2つを分けて考えるように書いています。
5. 抽選は、調べていません
この論文が調べたのは、オンラインの予約の仕組みです。本文は、これらの仕組みが「ほぼすべてオンラインで」運用されていると書いています。競争の測り方も、売り出し開始からの5分で測るものです。
抽選については、考察のいちばん最後に1文だけ出てきます。場合によっては、多くの川や人気のある登山先で使われているような、無作為に割り当てる仕組みが、より公平な枠の配分のために必要かもしれない、というものです。これは今後の案であって、この論文が抽選の結果を測ったわけではありません。
先行研究として、川の許可について抽選と「買い急ぎ」を比べた研究が紹介されていますが、それはこの論文の結果ではありません。
ですから、この論文から「抽選にすれば公平になる」は読めません。
6. 直前の枠だけにすれば公平、にもなりません
反対の読み方も、著者が先回りして否定しています。
本文の言い方はこうです。所得の低い郵便番号から来る人は、短い事前予約の期間や直前の予約を好むように見えるが、直前の市場での混み合った買い急ぎは、所得の低い人に不利に働く。したがって、直前の予約だけの形に移しても、公平さの問題が必ずしも解消されるわけではない、と。
本文は、この一文のところで具体的な公園を挙げていません。ただし、直前の枠の競争がどれくらい激しくなりうるかは、別のところに書かれたアカディアの数字に表れています。直前の枠の9割を超える分が、最初の5分で埋まっています。この2つを結びつけて読むのは、この記事のもので、著者がそう書いているわけではありません。
7. 海外からの来訪者は入っていません
上のデザインの節で書いたとおりです。生の標本のおよそ2パーセントが、所得が分からないという理由で分析から外れています。この人たちがどう予約していたかは、この研究からは分かりません。
8. 学歴も、郵便番号の単位です
本文は、所得のほかに学歴と人種にも触れています。補足の表に、学歴が枠の競争および事前予約と正の相関を示す結果がある、と書かれています。また、郵便番号のうち白人と答えた人の割合は、事前予約と正の関連があった、とも書かれています。白人と答えた人の割合と、枠の競争との関係については、本文に書かれていません。
ここで大事なのは、これらも郵便番号の単位だということです。所得と同じ限界がそのままかかります。「学歴の高い人が競争の激しい枠を取っていた」ではなく、「学歴の高い人が多い地域に住む人が、競争の激しい枠を取っていた」までです。数値は補足の表にあり、本文にはありません。
9. 著者は、予約制そのものを否定していません
ここは、この論文を紹介するときに一番曲がりやすいところです。
考察の冒頭は、予約制が国立公園の資源と来訪者の体験を守るのに効果的でありうる、という証拠に触れるところから始まります。そのうえで、こうした仕組みが公平さにも影響しうることを示した、という書き方です。
差の大きさについても、著者自身が控えめな言い方をしています。これらの差は控えめに見えるが、公園の管理者も利用者も、不公平だと受け取られる管理のやり方にはとても敏感だ、という一文です。
そして、管理者に向けた提案も、予約制をやめることではありません。事前の枠と直前の枠の割合を調整すること、売り出しをもっと段階に分けて試してみること、場合によっては抽選を使うことです。同時に、段階に分ければ枠がさらに細切れになり、競争の効果がかえって強まるかもしれない、という心配も書き添えられています。駐車場の容量が限られているため、アカディアとハレアカラの日の出の枠はとても競争が激しく、実験の余地が小さいことにも触れています。
先行研究との関係も、そのまま書かれています。公園の予約制と利用者の特徴を調べたもう1つの研究(Miller ら)は、アーチーズ国立公園の2022年の試行期間について、来訪者がより先まで計画を立てるようになったこと、所得の分布の上のほうで所得が高い証拠がいくらかあることを示しつつ、最終的には世帯所得に有意な影響はなかったと結論しています。この論文の著者は、1つの公園の1つの年を超えて見れば、事前予約の必要と予約の競争の両方に締め出しの効果があるという証拠が得られる、という書き方をしています。
なお、この論文は、序論では同じ Miller らの研究をザイオン国立公園のものとして紹介していて、考察のアーチーズ国立公園と公園名が食い違っています。この記事では、結果を詳しく書いている考察のほうに沿って書きました。
10. 日本の話は出てきません
この論文に出てくるのは、アメリカの7つの国立公園です。日本の山や観光地の入山予約について、この論文は何も調べていません。日本の話を思い浮かべながら読むのは自由ですが、そこにこの数字を当てはめることはできません。
元の論文の、どこを見ればよいか
手がかりを置いておきます。節の名前は論文のままです。
- 主な数字の表:Results の「Competition for reservations and income」の節にある Table 2 です。列の違い(1列目は許可の固定効果だけ、2列目は週末と祝日、3列目は年の週、4列目は許可ごとの週の効果、5列目はセミパラメトリック)も、この節の本文に書かれています。脚注に、標準誤差が許可×年でクラスターされていることと、印の意味、そして Federal Holiday と Weekend が出発日についての指標であることが書かれています。
- 3748ドルから4135ドル、2690ドルから3204ドル:同じ節の、表のすぐあとの段落です。343ドルから520ドルもここにあります。
- 生態学的誤謬についての著者の注意:同じ節のいちばん最後の段落です。「While it is tempting to interpret ...」で始まります。Oster の方法を使った検討は、補足の Table 2 と Table 3 に案内されています。
- 先行き期間の係数と、180日の約1万ドル:Results の「Advance purchase period length and income」の節です。約1万ドルの文は、Fig. 4 を紹介した段落の3文目にあります。Fig. 4 の説明に、10パーセント抽出とセミパラメトリック回帰のことが書かれています。
- 「事前に予約したがるだけでは公平さの問題にならない」という条件:同じ節の最後の段落です。「When interpreting the results in Table 2 and Fig. 4 ...」で始まります。
- ヨセミテの年ごとの変更と、1日あたり21ドルから24ドル:Results の「Advance purchase period in Yosemite」の節です。図は Fig. 5、回帰の結果は補足の Table 5 に案内されています。
- 枠を増やしたときの動き:Results の「Permits and competition in Glacier and Rocky Mountain」の節です。図は Fig. 3 で、グレイシャーが Fig. 3a、ロッキーマウンテンが Fig. 3b、ヨセミテが Fig. 3c です。
- 競争の測り方と、アカディアの9割:Results の「Reservation markets in Rocky Mountain and Acadia」の節です。図は Fig. 2 で、競争のグラフは Fig. 2e と Fig. 2f です。カディラック山の日の出の枠が1日およそ150であることは、Fig. 2d の説明と、「Figure 2c, d plot total permits reserved」で始まる段落にあります。
- 公園ごとの仕組みの一覧:Results の最初の節にある Table 1 です。Panel A が事前予約の期間、Panel B が受付期間と売り出しの時刻です。マウントレーニアの2日前や、ヨセミテの2023年が空欄であることも、Panel A で確かめられます。
- パーセントでの言い方と、著者の提案:Discussion です。最初の段落に3200ドルから4200ドル(4から5パーセント)と2700ドルから5000ドル(3から6パーセント)、30日から180日への変更についての1500ドルから3500ドルがあります。Miller らとの比較と「控えめに見える」の一文も、この段落です。
- データの作り方:Methods の「Data」です。RIDB、ACS、海外からの来訪者の除外、除いた2公園、Wayback Machine のことが書かれています。
- 回帰式:Methods の「Regression model」です。競争の4区分、先行き期間の6区分、当日予約が基準であることが書かれています。学歴と人種についての記述も、この節の最後の数文(3文)にあります。
- 個人の水準についての検討:Methods の「Signs of individual-level effects」です。R² の値と、Oster の係数安定性の検定の読み方が書かれています。
元の論文はこちらです。Hughes JE. Reservation policies and equity in national park access. Nat Commun. 2026;17:10109. https://doi.org/10.1038/s41467-026-76030-4
著者は1人です。本文は「we」で書かれていますが、Methods の個人の水準の節に「allows me to」という単数の言い方が残っています。この論文はオープンアクセスですが、営利での利用と、改変したものの再配布を認めないライセンス(CC BY-NC-ND 4.0)です。この記事はアフィリエイトのリンクを含むので、営利での利用にあたります。ですから、この記事には論文の図をそのまま載せていません。数字は本文から取り、言葉で説明しています。
見方を練習するために
この記事は本の紹介を含みます。下で紹介する本には、アフィリエイトのリンクを付けています。ページの上と下に出ている PR の表示は、そのことを示しています。リンクから買っても値段は変わりません。
この回の柱を、持ち帰れる形にします。所得、学歴、年齢といった数字が出てきたときに、順に当てる3つの問いです。
1つめ。その人に聞いた数字か、その人が住んでいる地域の数字か。この論文は、郵便番号の世帯所得の中央値でした。地域の数字だと分かると、言えることが変わります。「所得の高い人が取っていた」ではなく、「所得の高い地域に住む人が取っていた」までになります。この違いを、著者は生態学的誤謬という名前で呼んでいます。
2つめ。比べた相手は誰か。この論文の相手は、当日に予約した人でした。予約を取ろうとして取れなかった人ではありません。相手が変われば、同じ数字でも意味が変わります。ニュースの見出しには、比べた相手が書かれていないことがよくあります。
3つめ。幅は、何の幅か。「3748ドルから4135ドル」は、信頼区間ではなく、モデルの組み方を変えたときの推定値の幅でした。幅と書いてあるものを見たら、標本のばらつきの幅なのか、分析の選び方の幅なのかを確かめる。この2つは、答えている問いが違います。
この3つは、どれも「数字そのもの」ではなく、「数字の作り方」を見る問いです。作り方が分かると、同じ数字から言えることと言えないことの境目が見えます。
下の本は、正しい数字が、集め方や見せ方によってどこまで違う印象になるかを、身近な例で並べた古典です。とくに、平均や中央値といった代表値が、そこに含まれる一人ひとりの姿をどう隠すかを扱った章が、この回と重なります。この論文の著者も、まさにその点を自分で書いていました。
最後に一言だけ。この本は、この論文を疑うために挙げているのではありません。この論文は、測ったのが郵便番号の数字であることも、個人の水準では大きさが決められないことも、比べた相手が当日に予約した人であることも、すべて本文に書いています。気をつけたいのは、こうした結果が論文の外に出て、ドルの数字だけが切り取られたときです。
元の論文
Hughes JE ら. Nat Commun. 2026.
https://doi.org/10.1038/s41467-026-76030-4
もっと知りたい人へ
PRこの記事には広告(アフィリエイトのリンク)を含みます。