本文へ移動
交通と土地利用

世帯の自動車走行距離は何で変わるか:米国36都市圏の回帰分析と決定木

Understanding household VMT generation: A comparative analysis with traditional statistical models and a machine-learning approach

Guang Tian / Bob Danton / Bin Li / Vijaya Gopu / Julius A. Codjoe
Journal of Transport and Land Use

原文PDFを読む ↗論文の公開ページ ↗

米国36都市圏の世帯データを使い、自動車で走行するか、走行する世帯はどれだけ走るかを二段階で分析した研究である。

この論文のポイント

  • 米国36都市圏の107,949世帯について、走行の有無と走行世帯のVMTを二段階で分析した。
  • 走行の有無のAUCは多層回帰とBRTの双方で0.85、走行世帯の対数VMTの決定係数はそれぞれ0.20と0.22だった。
  • BRTの部分依存図では、活動密度や停留所密度とVMTの関連の強さが値域によって変わった。

背景と課題

VMTは自動車の走行距離を表す指標で、この研究では世帯ごとの総走行距離を扱う。居住地周辺の人口・雇用密度や土地利用、公共交通へのアクセスとVMTの関係を知ることは、交通計画に役立つ。ただし、密度が増すにつれてVMTとの関連の強さが変わる場合、一定の係数で関係を表す回帰モデルだけでは形を読み取りにくい。著者らは従来の回帰モデルと、複数の決定木を組み合わせる手法を同じデータで比べた。

研究の方法

観測単位は世帯で、対象は米国36都市圏の107,949世帯、1,059,678トリップである。日々の移動記録に記された距離、またはトリップの座標から地理情報システム(GIS)で求めた距離を使い、世帯の自動車走行距離を算出した。目的変数は、①VMTがゼロを超えるか、②ゼロを超える世帯のVMTの自然対数である。対数は、距離の分布が大きい値へ偏ることに対応するために用いる。説明変数には世帯人数、子ども・就業者数、所得のほか、居住地から道路網に沿って1マイル以内の活動密度(人口と雇用の密度)、土地利用の混合度、交差点・停留所の数などを用いる。車・公共交通で30分以内に到達できる雇用の地域全体に対する割合は、交通分析ゾーン間の所要時間と雇用数から計算する。地域人口、ガソリン価格、気候も加える。車両保有台数は、走行距離と相互に関係し得る内生的な変数として除外した。説明変数の重なりは分散拡大係数で点検し、最終モデルではすべて5未満だった。

計算は「二段階ハードル方式」で、まず走行の有無を分け、次に走行した世帯だけの距離を扱う。統計モデルの第1段階はロジスティック回帰で走行確率を求め、第2段階は線形回帰で対数VMTの期待値を求める。どちらも都市圏ごとに基準値である切片を変え、説明変数の係数は都市圏間で共通とする。第1段階の世帯属性などの係数は、値が増えたときの走行する「対数オッズ」の変化を表す。第2段階の係数は対数VMTの変化を表す。並行して、BRT(ブースト回帰木)を両段階に適用する。各木は説明変数の値で世帯を区分し、区分ごとに一定の予測値を持つ。BRTの予測値は、全体の基準値に、順に当てはめた木の該当区分の値を足したものになる。木を足す際の損失関数や更新の細部は本文に示されていない。学習率と木の本数は、交差検証誤差が小さくなる組み合わせを格子探索で選び、採用モデルは0.05、5,000本だった。出力した走行確率と走行世帯の対数VMTで予測性能を比べる。さらにBRTでは、分岐による改善を集計した変数の相対的重要度と、他の変数を考慮して一つの変数と予測値の関係を描く部分依存図から、関連の強い値域を読む。

この研究の新しさ

著者らが新規性として挙げるのは、定義をそろえた36都市圏の大規模な世帯データで、多層回帰とBRTの予測力や解釈を比較した点である。走行の有無と走行世帯の距離を分け、居住地周辺の環境とVMTの関連がどの値域で強まるか、弱まるかも調べている。

従来研究との違い

多層回帰の係数からは、モデルに投入した他の変数を考慮した関連の方向を読み取れる。BRTからは、変数の相対的重要度と非線形の形を調べられる。BRTの第1段階では、建造環境に関する変数の重要度の合計が71.89%、世帯属性が26.00%だった。第2段階では世帯属性が53.65%、建造環境が38.08%だった。重要度は木の分岐による予測上の改善に基づく値で、因果的な寄与率ではない。

結果と評価

論文は5分割交差検証で予測性能を比較したと述べる。走行の有無を判別する第1段階のAUCは両モデルとも0.85だった。AUCは、走行する世帯としない世帯を予測値で区別する性能を示す。走行世帯の対数VMTを扱う第2段階では、多層回帰の決定係数が0.20、予測誤差を表すRMSEが0.94、BRTはそれぞれ0.22、0.92で、差は小さかった。部分依存図では、活動密度とVMTの負の関連は人口と雇用の合計が1平方マイル当たり約2万人を超えると緩やかになる。1マイル以内の停留所数についても、約50か所の前後で関連の強さが変わる。これらは予測モデルで見られた関係である。

限界・注意点

著者らは、正確な世帯位置を提供できる地域に対象が限られたこと、都市圏によって調査年が11年超にわたることを述べる。各都市圏のデータは一時点だけで、経年変化は分析していない。編集上の解釈では、居住地の好みなどによる交絡も考慮すべきであり、密度や交通アクセスとの関連を施策の因果効果とは読めない。また本文の交差検証の説明は、5分割のうち1区画で学習し残りで検証すると記しており、分割の具体的な運用は明瞭でない。

現場への応用案

編集上の提案として、結果を「自動車で走行するか」と「走行する場合にどれだけ走るか」の二つの問いに沿って示すと、各段階で重要な変数の違いが伝わりやすい。密度や停留所数の目安は、部分依存図に見られる関連の変化点として紹介する。

現場で確かめるには

編集上の導入時の検証案として、対象地域でも世帯の移動記録と居住地周辺の環境指標をそろえ、走行の有無と走行世帯の距離を別々に予測する。地域や調査年を分けたデータでも誤差を確かめ、論文で示された約2万人・約50か所という値の周辺に十分な観測があるかを確認したい。整備施策の効果を判断するには、実施前後の変化を別途調べる必要がある。

解説は原文の要旨・本文の確認範囲に基づきます。AIで作成し、同じモデルで原文との照合を行っています。全記事の人手による校閲は完了していません。「現場への応用案」「現場で確かめるには」は編集上の検討案です。

← 解説の一覧へ原文PDFを読む ↗