本文へ移動
自転車

過去の同時刻と土地利用からシェアサイクルの駅別需要を予測する

Spatial-temporal deep learning model based on Similarity Principle for dock shared bicycles ridership prediction

Jiahui Zhao / Zhibin Li / Pan Liu / Mingye Zhang
Journal of Transport and Land Use

原文PDFを読む ↗論文の公開ページ ↗

サンフランシスコのドック式シェアサイクルを対象に、周期的な利用履歴と駅周辺の活動特性を組み合わせて到着・出発需要を予測した研究を解説する。

この論文のポイント

  • 2018年4~7月のFord Go Bikeの時間別データを使い、122駅の到着数と出発数を予測した。
  • 過去の同時刻付近の履歴を圧縮し、仕事・消費・交通・居住の属性で駅間の関係を表した。
  • 論文の比較では、提案法は通常のSTGCNNと、連続した過去期間を圧縮する構成より小さい予測誤差を示した。

背景と課題

シェアサイクルの利用数は時間帯や曜日で変わり、駅の周辺環境によっても異なる。駅への到着数と駅からの出発数を見積もることは、自転車の配置を考える材料になる。論文は、直近の履歴だけでは過去から繰り返す変動を捉えにくく、駅間の距離や道路情報だけでは利用者の活動に関わる駅同士の関係を表しきれない、という課題を扱う。

研究の方法

入力の単位は駅・時間ごとの利用数で、到着数と出発数を予測する。駅を節点、駅間の関係を辺とするグラフを用意する。各駅の時刻tまでの履歴は、直近の短期履歴と、過去の複数の日における予測時刻と同じ時刻付近の長期履歴に分ける。長期履歴には積層オートエンコーダー(SAE)を使う。これは入力を少数の値に符号化し、そこから元の入力を復元するよう学習する圧縮器である。本文の設定では30個の入力値から中間の6個の値を得る構造が示される。圧縮された値を短期履歴とつなぎ、時間方向の入力にする。ただし、本文のSAE損失式は復元値を入力に近づけるという説明と記号が一致しないため、式だけから実装を確定できない。

空間方向では、122駅のそれぞれに一つの区域を設け、土地利用計画と関心地点(POI、施設などの位置情報)から区域の属性を作る。主な設定では仕事・消費・交通・居住の4属性を使う。駅の組ごとに、対応する属性値の差の絶対値を4属性分足し、駅間の関係行列の値とする。同じ尺度で比べれば、値が小さいほど活動特性が近い。比較用には7種類の土地利用属性、道路属性、緯度経度に基づく距離からも行列を作る。属性の尺度をどう揃え、差の値をグラフ上の結合強度としてどう扱うかは本文で明示されていない。

圧縮した履歴と関係行列を時空間グラフ畳み込みネットワークに渡す。時間側のゲート付き畳み込みは、履歴から計算した値に、別に計算した0~1の通過率を要素ごとに掛け、次の層へ渡す情報を調整する。空間側は、駅間の関係を表す行列を基に各駅の情報を組み合わせる。本文では計算量を抑えるため、グラフ上の演算をチェビシェフ多項式で近似する式を示す。時間・空間・時間の処理を重ね、次の時点の駅別到着数または出発数を出力し、実測値との差の二乗を使って学習する。複数時点については入力する時間窓をずらして予測する。得られるのは需要の見込みであり、再配置台数の決定手順は示されない。

この研究の新しさ

著者らは、予測対象と似た時間・場所の情報を選んで組み込む方針を「類似性原理」と呼ぶ。その具体化は、過去の同時刻付近の履歴を圧縮して直近の履歴に加えることと、駅間の関係を活動に関わる土地利用属性で表すことにある。既存の時空間グラフ予測器に、この二つの入力設計を組み合わせた点が提案の中心である。

従来研究との違い

比較対象には、自己回帰和分移動平均モデル(ARIMA)、サポートベクターマシン(SVM)、長短期記憶ネットワーク(LSTM)、通常の時空間グラフ畳み込みネットワーク(STGCNN)が含まれる。時間情報の比較では、連続した過去の一期間をSAEで圧縮する構成も設けた。表5の平日・到着数の平均絶対誤差(MAE)は、通常のSTGCNNが1.243、その圧縮構成が1.126、提案法が1.110である。空間情報を替えた表6の同じ指標では、道路属性1.321、距離1.313、7属性の土地利用1.223、4属性の土地利用1.110だった。いずれもこのデータと評価条件での比較である。

結果と評価

Ford Go Bikeの2018年4月1日から7月31日までの時間別利用数を使い、122駅を対象とした。データの70%を学習、20%を検証、10%をテストに割り当て、MAEと二乗平均平方根誤差(RMSE)を報告している。表5では、平日・週末の到着数・出発数のいずれも、提案法の両誤差は二つの時間情報の比較対象より小さい。1~6時間の間隔を比べた表4では、誤差はおおむね短い間隔で小さいが、すべての欄で一様に変化するわけではない。土地利用属性と予測値の関係は部分依存プロットでも調べているが、その関連から土地利用の因果効果は判断できない。

限界・注意点

著者らは、サンフランシスコの一つのサービスに依存するため他都市への一般化に限界があること、急な行動変化や予期しない出来事への適応、データの偏りや公平性を今後検討すべきことを挙げる。再現時に確認が必要な点として、本文には属性値の尺度調整、属性差からグラフの結合強度への変換、学習・検証・テストの時間的な分け方が明示されていない。また、SAEの損失式は本文の復元に関する説明と記号が整合しない。

現場への応用案

編集上の応用案として、駅別予測を紹介する際は、市全体の平均誤差に加え、平日・週末、到着・出発、駅周辺の活動特性ごとに誤差を示すとよい。どの場面で見込みが外れやすいかを読者が確認できる。この情報提示方法の効果は論文で検証されていない。

現場で確かめるには

編集上の導入時の検証案として、運用地域のデータを時間順に分け、後の期間だけで予測誤差を測る。駅・時間帯・曜日別にMAEとRMSEを確認し、土地利用属性、距離、道路属性を同じ条件で比べる。さらに、予測を使った再配置後の欠車・満車と運用負担を別途測る。予測誤差の改善が配置の改善につながるかは、この論文の結果だけでは分からない。

解説は原文の要旨・本文の確認範囲に基づきます。AIで作成し、同じモデルで原文との照合を行っています。全記事の人手による校閲は完了していません。「現場への応用案」「現場で確かめるには」は編集上の検討案です。

← 解説の一覧へ原文PDFを読む ↗