交通記録から土地利用はどこまで分かるか――サンフランシスコの区域別推定
Using traffic data to identify land-use characteristics based on ensemble learning approaches
交通イベントと車両の動きを区域ごとに集計し、既存資料に記された土地利用の種類と強度を推定した研究である。
この論文のポイント
- 2020年のサンフランシスコ市を主な対象に、交通イベントと車両記録をTAZ・時間帯ごとの特徴量に集計した。
- 既存の土地利用資料をラベルとして、5用途の分類と8指標の強度推定にランダムフォレストとAdaBoostを適用した。
- 比較表では両手法が多くの項目で良好だが、最良の手法は用途や評価指標によって異なる。
背景と課題
土地利用を把握するには、住宅や業務といった用途に加え、各用途が区域内にどの程度あるかを知る必要がある。論文は、調査や社会経済統計に頼る方法には費用と時間がかかり、日々の活動に伴う区域間の違いも捉えにくいと問題提起する。そこで、交通の発生時刻や場所を土地利用の手掛かりにできるかを調べた。
主な対象は2020年のサンフランシスコ市である。分析の空間単位はTAZ(交通分析のために区切った区域)で、市内には891区域がある。研究の問いは、観測された交通から活動の実態を直接測ることではなく、区域に対応付けた既存の土地利用資料をどこまで推定できるか、である。
研究の方法
入力となるのは、位置・時刻・種類・深刻度・影響距離を持つ交通イベントと、位置・時刻・速度などを持つ車両記録である。まず各記録の緯度経度をTAZに対応付ける。次に平日を4区分、週末を3区分の時間帯に分け、イベントは件数、種類別・深刻度別の割合、影響距離の平均と標準偏差を集計する。車両は件数と速度の平均・標準偏差を集計する。こうして点ごとの記録を、区域と時間帯に対応した交通特徴量、すなわち学習に使う数値の組へ変える。実験には交通データの週平均を使ったと記されている。
推定先の正解ラベルは二組ある。分類用は2020年4月時点のゾーニング図に基づく住宅、業務、工業、商業、交通の5用途で、本文は用途名をワンホット符号に変換すると説明する。回帰用は住宅、医療、文化・教育、業務、工業、小売・娯楽、来訪者向け施設、道路の8指標である。土地利用区画はTAZより小さいため、区画を区域内で集約する。示された強度の式は、各区画の「用途別の値×区画面積」を足し、区画面積の合計で割る面積加重平均を意図している。ただし、元の用途別の値の作り方や、抽出された式の分母の記載は明瞭でない。道路指標には道路延長、交差点密度、信号や一時停止の割合などを用い、主成分分析(複数の指標に共通する変動をまとめる方法)で統合する。8指標は比較のため0~100に正規化される。
学習では、各標本の交通特徴量を説明側の値、既存資料から作った用途または強度を推定先の値とする。ランダムフォレストは標本を取り直して複数の決定木を作り、各分岐でも候補となる特徴量の一部から分け方を選ぶ。新しい標本には、分類なら木の多数決、回帰なら木の予測値の平均を返す。AdaBoostは木を順に学習する。本文の2値分類の式では、最初は各標本を同じ重みとし、誤分類率が小さい木ほど最終判定での重みを大きくする。正しく分類した標本の重みを下げ、誤った標本の重みを上げて次の木を学習する。回帰でも予測誤差を最大誤差に対して相対化し、誤差に応じて標本の重みを更新する。最終的な出力は用途の判定または用途別強度で、留保した標本のラベルと比較する。ただし、2値分類の説明を5用途の実験にどう接続したか、回帰の木の出力を厳密にどう統合したかは、本文の記述だけでは追い切れない。
この研究の新しさ
論文の特徴は、交通量に相当する車両記録だけでなく交通イベントも使い、時間帯ごとの違いから、同じTAZ単位で用途の分類と強度の回帰を試した点にある。複数の木を組み合わせるアンサンブル学習を、この二つの課題に適用した。もっとも、出力は人間活動を直接観測した値ではなく、既存の土地利用資料を教師として得た推定値である。
従来研究との違い
比較には、近い事例を参照するK近傍法、サポートベクターマシン、深層ニューラルネットワークなどを用い、分類にはナイーブベイズも加えている。表からは、一つの手法が全用途・全指標で最良とは言えない。例えば業務用途のAUCはランダムフォレストが0.8576、ニューラルネットワークが0.7780である。AUCは判別性能を表し、大きいほどよい。一方、交通用途のAUCはニューラルネットワークが0.8865で、ランダムフォレストの0.7483を上回る。回帰でも小売・娯楽の平均絶対誤差はAdaBoostが4.3976、ランダムフォレストが5.1386だった。
結果と評価
論文は標本を学習・検証・試験に分け、分類にはAUC、正解率、適合率、再現率、F1を、回帰には平均二乗誤差、平方根平均二乗誤差、平均絶対誤差を用いる。平均絶対誤差は正解と推定値の差の絶対値を平均したもので、小さいほどよい。比較表では二つのアンサンブル法が多くの項目で良好だが、本文の「最良」とする記述には、同じ表の指標別の値と一致しない箇所もある。改善率だけで優劣を判断せず、用途と指標をそろえて読む必要がある。
さらに論文は、用途別の予測誤差同士の相関や、季節ごとの推定結果とラベルとの対応を調べる。誤差の相関はモデルの誤り方の関係であって、交通が土地利用を変えるという因果関係の証拠ではない。季節別分析でも基準となる土地利用資料は2020年4月時点のため、各季節の実際の用途変化を検証した結果とは区別すべきである。
限界・注意点
著者は、より多くのデータセットや別のモデルで信頼性を試すこと、交通と人間活動の時間的な因果関係を今後調べることを課題に挙げる。編集上の留意点としては、市内の891TAZに対して実験用標本は3924件と記されるものの、標本をどう作り、TAZと対応させたかが十分明確でない。また、記載された学習・検証・試験の件数は合計しても総標本数と一致しない。報告された精度を未知の都市や期間へそのまま一般化することはできない。
現場への応用案
編集上の応用案として、区域別の推定結果を「確定した土地利用図」として示す代わりに、時間帯別の交通特徴と既存の用途指定を並べて見せたい。両者が食い違う区域を取り上げれば、指定された用途と交通に表れた活動の違いを説明する入り口になる。
現場で確かめるには
編集上の導入時の検証案として、まず車両記録とイベント記録の届く範囲や欠測の偏りを区域別に調べる。そのうえで、学習に使わない区域や別時点の土地利用資料と照合し、用途別の誤判定と強度の誤差を確認する。道路に関する値が説明側と正解ラベル側の双方に関わる可能性もあるため、投入する特徴量を明示し、道路関連値の有無による成績の違いを確かめたい。
解説は原文の要旨・本文の確認範囲に基づきます。AIで作成し、同じモデルで原文との照合を行っています。全記事の人手による校閲は完了していません。「現場への応用案」「現場で確かめるには」は編集上の検討案です。
