提取月份需先用 pd.to_datetime() 转为 datetime64 类型,再用 .dt.month;周数应使用 .dt.isocalendar().week(ISO 8601 标准),避免已弃用的 .dt.week;星期名优先用 .dt.day_name() 或 .dt.dayofweek 映射中文;性能敏感时宜缓存 DatetimeIndex。

用 dt.month 提取月份时,必须确保列是 datetime64 类型
直接对字符串或 object 类型的日期列调用 .dt.month,Pandas 会毫不客气地甩给你一个 AttributeError: Can only use .dt accessor with datetimelike values。它可不会自动把字符串识别成时间,你得手动转换一下。
- 先用
pd.to_datetime()转换,遇到无法解析的值默认设为NaT(推荐加errors='coerce',更稳妥) - 检查类型:转换后用
df['col'].dtype确认是否为datetime64[ns] - 如果原始数据里混着不同格式(比如 "2023-01" 和 "Jan 2023" 混在一起),
to_datetime可能直接罢工,得先统一格式,或者用format参数明确指定
dt.week 和 dt.isocalendar().week 返回结果不同
dt.week 在新版 Pandas(>= 1.1)中已经被弃用了,实际跑的时候会触发 FutureWarning。它返回的“第几周”基于年份起始日来算,定义模糊,跨年时尤其容易出问题。真正靠谱的是 dt.isocalendar().week——严格遵循 ISO 8601 标准:每周从周一开始,第 1 周必须包含当年第一个周四。
- 旧写法
df['date'].dt.week→ 改成df['date'].dt.isocalendar().week isocalendar()返回一个 DataFrame(包含 year/week/day 三列),取周数只需加.week- 注意:ISO 周可能跨年,比如 2024-12-30 实际上是 ISO 第 1 周(属于 2025 年),别硬套“日历月”的逻辑去理解
提取周几名称或数字?优先用 dt.day_name() 和 dt.dayofweek
dt.day_name() 返回字符串(比如 "Monday"),语言受当前 locale 影响;dt.dayofweek 返回整数(周一=0,周日=6),稳定且适合后续计算。
- 需要排序或分组时,用
dayofweek更安全——字符串排序是按字母序,不是时间序,容易乱 - 想输出中文星期?别折腾 locale,直接映射:
df['date'].dt.dayofweek.map({0:'周一', 1:'周二', ...}),干净利落 dt.weekday_name已经废弃了,和dt.week一样,新版会报错
性能敏感场景下,避免链式调用 .dt 多次
每次调用 .dt 都会触发内部类型校验和视图构建。如果既要取年、月、日,又要取周,一次性调用 isocalendar() 或用 dt.to_period() 比反复点 .dt.year、.dt.month 快得多。
- 低效写法:
df['y'] = df['t'].dt.year; df['m'] = df['t'].dt.month - 高效写法:
df[['y','m','d']] = df['t'].dt.to_period('D').to_timestamp().to_frame().apply(lambda x: (x.dt.year, x.dt.month, x.dt.day))—— 不,太绕了;更实用的是:df['ymd'] = df['t'].dt.strftime('%Y-%m-%d')或直接用pd.DatetimeIndex(df['t'])缓存索引再取 - 真正大批量时,先转
DatetimeIndex:idx = pd.DatetimeIndex(df['t']); df['month'] = idx.month,比反复走.dt快 2–3 倍
ISO 周编号和 locale 相关的名称是最容易出错的两个点——一个规则隐蔽,一个行为不可控。别依赖默认,显式声明意图才是省事的关键。