在时间序列分析中,我们经常遇到这样一个场景:手里有一批高频观测数据,比如传感器每15秒采样一次,同时还有另一份低频参考时间点,比如每5分钟一次的校准时刻。现在需要把这两组数据对齐,并且为每个参考时刻计算其前后各2.5分钟(共5分钟)窗口内的均值——注意,这个窗口必须严格以参考时间为几何中心,而不是左对齐或右对齐。听起来简单,但实际做起来有不少细节需要注意。pandas 提供了两个利器——rolling(..., center=True, on="time") 和 merge_asof(),组合使用就能优雅解决这个问题。
✅ 正确实现步骤
1. 为 df1 构建中心化滚动均值列
先对高频数据 df1 计算每个时间点为中心的5分钟滚动均值。关键参数是 window="300s"(300秒=5分钟)、on="time"(指定时间列)和 center=True(确保窗口以当前行为中点)。注意,这个操作会自动处理边界,但为了不让首尾行因为窗口不完整而变成NaN,可以加上 min_periods=1。代码很直接:
import pandas as pd
# 确保 time 列为 datetime 类型
df1["time"] = pd.to_datetime(df1["time"])
df2["time"] = pd.to_datetime(df2["time"])
# 计算 df1 中每个时间点为中心的 5 分钟滚动均值
df1_rolling = df1.rolling(
window="300s",
on="time",
center=True,
min_periods=1 # 可选:允许边界处少于完整窗口仍计算
).mean().rename(columns={"speed": "speed_a vg"})
# 合并回原 df1(按索引对齐)
df1_with_a vg = df1.join(df1_rolling)
这里有个小陷阱:rolling 返回的结果与输入 df1 索引一致,所以用 join 最安全,千万别用 merge 去对时间,否则容易因为精度问题搞错行。
2. 时间对齐:用 merge_asof 匹配最近邻时间点
接下来,要把 df2 中的每个参考时间点,在 df1_with_a vg 中找到最接近的那一行。pandas 的 merge_asof 就是为此而生的。不过默认的 direction="backward" 只往前找,我们需要的是“最接近”(可前可后),所以推荐用 direction="nearest"(需要 pandas ≥ 1.4.0)。同时加上 tolerance 限制最大偏差,比如15秒,避免匹配到太远的数据:
# 关键:必须按 time 排序!
df1_sorted = df1_with_a vg.sort_values("time")
df2_sorted = df2.sort_values("time")
# 使用 direction="nearest" 实现双向最近匹配
result = pd.merge_asof(
df1_sorted,
df2_sorted.rename(columns={"speed": "speed_df2"}),
on="time",
direction="nearest",
tolerance=pd.Timedelta("15s"), # 允许最大 15 秒偏差
allow_exact_matches=True
)
# 过滤掉未成功匹配的行(speed_df2 为 NaN)
result = result.dropna(subset=["speed_df2"]).reset_index(drop=True)
3. 输出结果解读
最终得到的 result 表格里,你会看到四类关键列:
- time:来自 df1 的实际时间戳(即最接近 df2 参考时刻的那个观测点);
- speed:df1 原始瞬时值;
- speed_a vg:以该 time 为中心、前后各2.5分钟(共5分钟)窗口内 df1.speed 的均值;
- speed_df2:df2 中对应参考时刻的原始值(可用于后续校准、对比等)。
举个例子:如果 df2 中有一个时刻是 2022-10-04 00:13:24,它匹配到了 df1 的 2022-10-04 00:13:25,那么 speed_a vg = 3.687 就是 00:10:55 至 00:15:55 区间内所有 df1.speed 的平均值。
⚠️ 注意事项与最佳实践
- 时间列必须为 datetime64[ns]:务必调用
pd.to_datetime()显式转换,否则 rolling 的 on 参数会报错; - merge_asof 前必须排序:on 列升序是强制要求,否则结果不可靠;
- 窗口大小单位灵活:
window="300s"也支持"5T"(5分钟)、"300S"等字符串格式,推荐用pd.Timedelta显式声明更清晰; - 边界处理:
min_periods=1防止首尾行因窗口不完整而返回 NaN;若需要严格满窗,可以设min_periods=30(约 5min/15s ≈ 20 个点,按实际频率调整); - 性能提示:对超大数据集,可先用
df1.set_index("time").sort_index()提升 rolling 效率。
通过以上方法,就能精准实现「以另一数据框时间点为锚,计算高频数据中心化滚动统计」这一典型工业场景需求。整个过程其实就两步:先算中心化滚动均值,再做最近邻匹配,搞定。