本文へ移動
交通と土地利用

売買履歴から物件用途を補う:トロント=ハミルトン地域の土地利用分類

A prototype machine learning residential land-use classifier using housing market dynamics

Shivani Raghav / Stepan Oskin / Eric Miller
Journal of Transport and Land Use

原文PDFを読む ↗論文の公開ページ ↗

区画ごとの売買履歴と地域統計を結び付け、用途が記録されていない不動産取引を3群に分類した研究である。

この論文のポイント

  • 売買取引に地域統計や用途資料を位置・時点で結び付けるデータベースを構築した。
  • 同一座標の売買件数や取引間隔などを使い、取引の物件用途を3群に分類した。
  • 2011~2014年の記録を無作為分割した試験では、ランダムフォレストの正解率が97%だった。

背景と課題

交通の利便性は世帯や企業の立地選択に関わり、土地利用の変化は移動需要にも関わる。両者を扱う都市モデルには、細かな場所と時点を追えるデータが役立つ。オンタリオ州のTeranet売買記録には取引日、価格、区画の位置がある一方、物件用途や建物の構造情報がない。論文はグレーター・トロント=ハミルトン地域(GTHA)を対象に、異なる資料を結合して住宅市場データベースを作り、欠けている用途を推定した。交通量を予測する研究ではなく、交通・土地利用研究にも使える物件属性を整える研究である。

研究の方法

入力の単位は、日付と区画中心のXY座標を持つ個々の売買取引である。Teranetの区画識別番号、住所、価格などを起点に、識別番号の重複、欠損、極端に低い価格や外れ値を点検・処理する。ただし、除外や補正の具体的な規則は本文にない。次に、国勢調査の小地域であるDAと、世帯交通調査の交通分析ゾーンであるTAZを、取引地点に対応付ける。DAの統計は2016年の区域境界、TAZの統計は2001年の境界にそろえる。国勢調査と交通調査の値は、調査年を中心とする5年間の取引に割り当てる。例えば2016年の調査値は2014~2018年に対応する方式であり、その各年を実測したわけではない。用途資料も利用できる時点に応じて空間結合し、識別キーを介して参照できる関係データベースに収める。データベース構築の対象期間は2001~2016年である。

分類に向けては、同じXY座標の取引をまとめ、最初の取引かどうか、過去および全期間の取引件数、前回・次回取引までの年数、取引価格の中央値を計算する。これら6変数に、DA単位の平均家賃、5階以上の集合住宅の割合、平均世帯人数、人口密度、住戸密度の5変数を加える。正解ラベルには詳細な用途資料を使い、2011~2014年の記録を「コンドミニアム」「戸建て・半戸建て・タウンハウス等」「その他」の3群にまとめた。複数の変数選択法で選ばれた計11変数を用い、各群の比率を保って記録を訓練用70%、試験用30%に無作為分割する。訓練用データでは交差検証とグリッド探索で分類器の設定を調整し、試験用データで比較した。最良のランダムフォレストは50本の決定木と、分岐先で用途群がどれだけ混在するかを表すジニ不純度を用いる。本文は木ごとの構築手順や集約規則までは詳述していない。出力は取引ごとの3群の判定で、選ばれたモデルを1986~2017年の記録に適用し、新たな属性として保存した。

この研究の新しさ

用途がない取引記録に対し、地域の平均値だけでなく、同一座標での売買回数や売買間隔を物件用途の手掛かりにした点が特徴である。また、区画、DA、TAZという異なる空間単位と、異なる時点の資料を、取引の位置・年から参照できる形に整理した。著者らは、取引履歴から作った区画水準の変数が、DA水準の国勢調査変数より分類に強く寄与したと報告する。これは予測への寄与であり、売買頻度が用途を決めるという因果関係を示すものではない。

従来研究との違い

比較対象には線形モデル、最近傍法、決定木、ランダムフォレストなどが含まれる。2011~2014年の試験用記録では、良好な線形モデルの正解率がおよそ75%だったのに対し、決定木とランダムフォレストはいずれも95%を超え、50本の木を使うランダムフォレストが97%で最良だった。国勢調査変数も精度改善に役立つとして残された。一方、交通調査の変数やDMTIの用途データはデータベースには結合されているが、この11変数による分類比較で直接用いた変数には含まれない。

結果と評価

正解率は、全記録のうち用途群を正しく判定した割合を指す。論文は群ごとの適合率、再現率、両者をまとめたF1値も確認しているが、図から細かな数値は補わない。主な評価は2011~2014年の記録を無作為に分けた試験用30%に対するものだった。別に2010年と2015年の記録も確認したが、正解ラベルの基となる詳細用途は主に2012~2013年に収集されており、両年のラベルはより不確かだと著者らは述べる。学習曲線からは、木に基づくモデルに訓練データへのある程度の過適合も見られた。

限界・注意点

著者らが述べる制約は、詳細な用途ラベルの収集時期が限られること、木に基づくモデルの過適合、誤分類がコンドミニアムや複合用途など取引頻度の高い地点に集中する傾向である。3群への集約は、細かな用途まで判別できたことを意味しない。さらに編集上の留意点として、同一座標が個々の物件を十分に区別できるか、無作為分割で得た精度が別の時期や地域でも保たれるかは、この評価だけでは確定しない。1986~2017年の記録に分類を付けたことと、その全期間で97%の正解率を確認したことは別である。

現場への応用案

【編集上の応用案】土地利用と交通指標を重ねて示す際は、「資料から直接付けた用途」と「売買履歴から補った用途」を地図や時系列で区別したい。推定された用途変更を観測済みの変更と同列に扱わず、属性の出所と基準時点を読者が確認できる表示にする。

現場で確かめるには

【編集上の導入時の検証案】別の地域や期間で使うなら、その時点に確認された区画用途を用意し、期間を分けた検証と地点を分けた検証を追加したい。次回取引までの年数、全期間の件数、全取引の価格中央値は、判定時点より後の情報を含み得る。過去の時点までに利用可能な情報だけで計算し直して精度を比べれば、履歴を後から整理する用途と、その時点で判定する用途を区別できる。用途群別に加え、取引頻度の高い地点の誤分類も点検する。

解説は原文の要旨・本文の確認範囲に基づきます。AIで作成し、同じモデルで原文との照合を行っています。全記事の人手による校閲は完了していません。「現場への応用案」「現場で確かめるには」は編集上の検討案です。

← 解説の一覧へ原文PDFを読む ↗