本文へ移動
交通と土地利用

シドニーの世帯はいつ転居するか:居住期間と交通利便性の予測

Sydney’s residential relocation landscape: Machine learning and feature selection methods unpack the whys and whens

Maryam Bostanara / Amarin Siripanich / Milad Ghasri / Taha Hossein Rashidi
Journal of Transport and Land Use

原文PDFを読む ↗論文の公開ページ ↗

シドニーの転居履歴を使い、世帯の居住期間を予測するモデルと、予測に役立つ変数を比較した研究です。

本文の一部を省略した入力に基づく解説です。省略部分の結果や条件は原文PDFで確認してください。

この論文のポイント

  • シドニーの512人から得た1,024件の居住記録を使い、転居が未観測の記録も含めて居住期間を分析した。
  • 古典的な生存時間モデルも、木に基づく変数選択を組み合わせると上位の機械学習モデルに近いC指数を示した。
  • 住宅所有や最近の生活上の変化が予測に関わり、複数モデルの予測を重ねてもC指数の改善は小さかった。

背景と課題

交通計画では、世帯がどこに住むかとともに、いつ転居するかが通勤や公共交通の需要を考える手掛かりになる。ただし、調査時点で同じ家に住み続けている世帯については、最終的な居住期間が分からない。このように転居時点を観測できない記録を「打ち切り」と呼ぶ。本研究は、打ち切りを含む履歴から、住宅所有、生活上の出来事、移動時間、居住地の交通利便性と居住期間との関係を調べる。

研究の方法

分析単位は、2019年にシドニー都市圏の512人を対象に行った回顧調査から得た1,024件の居住記録である。目的変数は入居後の居住期間と、転居が観測されたかを示す指標。転居が未観測の記録も、その時点まで住んでいた情報として使う。説明変数には住宅所有、世帯構成、所得、就職や出産などの出来事、住宅選択時に重視する条件を含める。前処理では、平日午前8時出発を仮定し、自宅・職場・学校の郵便番号から車と公共交通による所要時間を推計して世帯内で平均する。地区の土地利用割合と、各地区から30分以内に到達できる仕事の数も結合し、最終的に163の説明変数を用意する。

次の住宅の利便性を表す変数は、別の線形モデルで推定する。ここでの利便性は、車で30分以内に到達できる仕事の数である。二つの住宅が分かる記録について「次の住宅の利便性−元の住宅の利便性」を計算し、この増減を元の住宅の利便性、住宅選択に関する16項目の回答、世帯属性などで説明する。係数は、他の投入項目が同じとき、各項目の違いが増減とどう結び付くかを表す。推定した増減を元の住宅の値に足して、次の住宅の利便性を見積もる。回答を加えるのは、世帯が好みに沿って居住地を選ぶことによる偏りを考慮するためだが、それだけで偏りの解消や因果関係の特定が保証されるわけではない。

居住期間の分析には、打ち切りを扱う生存時間モデルを使う。古典的な3種と機械学習による10種を、変数選択なしの場合、および6種の選択法と組み合わせた場合で比較する。選択法は、各変数を単独で評価する方法、目的変数との関連を保ちつつ変数間の重複を抑える方法、ランダムフォレストによる重要度などである。外側の5分割で評価用記録を分け、訓練用記録内の5分割でモデルと変数選択の設定を調整する。指標のC指数は、比較可能な二つの記録について、予測した転居リスクの順序が観測された順序と合う割合を表す。出力は組合せごとの平均C指数と、選ばれた変数である。提示本文は各学習器の目的関数、更新則、設定値の探索範囲までは示しておらず、その実装手順は補えない。

この研究の新しさ

著者らが研究の特徴とするのは、転居までの期間について多数の生存時間モデルと変数選択法を同じデータで比べ、現在の住宅に加えて次の住宅の推定利便性も検討した点である。住宅選択時の意向を質問票から取り込み、自ら居住地を選ぶ傾向にも対応を試みている。

従来研究との違い

変数選択を使わない古典的な3モデルの平均C指数は0.491~0.516だった。木に基づく変数選択法を組み合わせると、おおむね0.76台となり、上位の機械学習モデルに近づいた。GBMは変数選択なしで0.773、RANGERによる選択との組合せで0.775だった。手作業と自動選択を別途比較した対数正規AFTモデルでは、平均C指数がそれぞれ0.7555と0.7909と報告されている。この二つの値を、モデル一覧の値と同一条件での順位として扱うことはできない。

結果と評価

変数選択の結果では、住宅所有の有無の重要度が0.98と報告され、最近の出産や車の購入、公共交通による通勤・通学時間も高い値を示した。これは予測への寄与を表す分析であり、転居を引き起こす効果の大きさではない。著者らは、現在と予想される次の住宅の利便性が重要とされたモデルは約20%だったとまとめている。

複数モデルの予測を重ねてもC指数の改善は小さかった。モデル間で順序判定を誤る記録の組が重なり、居住期間が短く、二つの記録の期間が近い組ほど判定が難しい傾向も報告された。C指数が評価するのは記録間の順序であり、個々の世帯の転居日が正確に当たることを意味しない。

限界・注意点

著者らは、住宅選択の意向を尋ねるデータは得にくく、次の住宅の利便性を推定するモデルの利用場面が限られること、転居先そのものの選択は詳しく扱っていないことを挙げる。異なるモデルでも順序判定を誤る組が重なる点も、報告された予測上の限界である。編集上は、回顧調査と本人の回答を用いた交絡への対応だけで因果関係が確定したとは読まない。提示本文には中間部分の省略があり、付録も含まれていないため、欠けた推定条件や実装は確認できない。

現場への応用案

編集上の応用案として、転居時期を説明する記事では「所有か賃貸か」「直近の生活上の変化」「現在と次の住宅の交通利便性」を分けて示せる。各項目は予測との関連として紹介し、交通施策によって転居時期が変わるという因果的な主張とは区別する。

現場で確かめるには

編集上の導入時の検証案として、別の年や地区の転居履歴で同じ変数を作り、転居が未観測の記録も含めてC指数を再計算する。所有者と賃借人、最近の生活上の出来事の有無ごとに順序判定を確認する。次の住宅の利便性を推定する段階も訓練用データの内側で行い、評価用データの情報が推定に入り込まないか点検したい。

解説は原文の要旨・本文の確認範囲に基づきます。AIで作成し、同じモデルで原文との照合を行っています。全記事の人手による校閲は完了していません。「現場への応用案」「現場で確かめるには」は編集上の検討案です。

← 解説の一覧へ原文PDFを読む ↗