个体出行OD序列生成数据集
一、数据集概述
针对真实个体出行数据分布不均、部分类别稀缺的问题,本数据集通过融合不同规律类型与规律程度的出行,构建了均衡的个体出行OD序列数据集。该数据集可作为“下一个出行地点预测”模型的训练集,可有效缓解样本不均衡问题,提升预测模型的准确率与泛化能力。
二、数据集内容
本数据集共包含2060个个体的出行OD序列,累计出行记录627448条,每个个体的最大出行地点数为190;每条数据均包含出行时段和出行地点信息。该数据集由四种核心出行规律(“个体出行终点分布”、“个体出行起点-终点分布”、“个体出行时段-终点分布”及“个体出行时段-起点-终点分布”)按不同比例融合而成,具体生成方法详见论文《Cross-City Zero-Shot Transfer Learning for Next Location Prediction With Knowledge Aggregation and Selection Framework》。
通过对比不同出行的占比,可为每个个体定义其专属的“规律类型”及相应的“规律程度”(例如:若某主体的“个体出行起点-终点”规律出行的占比最高且为 0.6,则其规律类型即为“个体出行起点-终点分布偏好”,规律程度为 0.6)。依据占比最高的出行类型,个体可被划分为四类偏好群体:个体出行终点分布偏好型(Gpd)、个体出行起点-终点分布偏好型(Gpod)、个体出行时段-终点分布偏好型(Gptd)以及个体出行时段-起点-终点分布偏好型(Gptod)。如下图所示,本数据集在不同规律类型和程度下的个体样本分布较为均衡,这有助于预测模型学习到泛化性能更强的出行预测规律。
图1 数据集规律类型和规律程度分布
三、数据文件描述
本数据集以一个txt文件的形式存储,每行数据代表一个个体的完整od序列,具体包括个体编号,个体类型(默认为-1),个体od序列数据,并用“#”号分隔。在od序列中,不同出行用”,”号分隔,每次出行包含出行地点编号,出行日(工作日取值为0,非工作日取值为1),出行时段(根据工作日和非工作日划分为48个时段),并用“-”号分隔。
四、数据提供单位
本数据由中山大学提供。
五、引文格式
Liuhong Huang, Zhaocheng He*, Xiying Li, Zhi Yu*. Cross-City Zero-Shot Transfer Learning for Next Location Prediction With Knowledge Aggregation and Selection Framework[J]. IEEE Transactions on Intelligent Transportation Systems, 2026, 27(5): 5317-5332.
注 :下载数据后解压时请使用除winRAR以外的解压工具进行解压