“python代码大全”这类搜索,真正有用的答案不是把几百段代码贴在一起,而是让人能在需要时找到、复制、测试,再安全地放回自己的项目。下面按文件、网络、数据处理和调试四个场景,整理一套可以继续扩展的 Python 代码片段工具箱。

先约定一个原则:片段解决重复劳动,函数负责稳定接口。示例只使用 Python 标准库,代码没有在本文环境中统一跑完整基准,因此不虚构耗时或性能数字;复制后请在自己的 Python 版本中执行测试。

先按场景给代码片段分区

打开一个项目时,最常见的重复代码通常落在四个地方:读写文件、调用 HTTP 接口、清洗数据、记录日志和验证结果。把它们按场景分组,比按语法分类更容易检索。

Python 代码片段工具箱的场景分区

图:文件 I/O、网络请求、数据处理和调试测试四个分区,最终汇聚到可复用函数模块。

文件读写:先把编码和异常说清楚

处理文本时显式指定编码,能避免“在本机正常、换台机器乱码”。同时不要吞掉异常,否则文件路径写错时只会得到一个空结果。

from pathlib import Path


def read_text(path: str | Path, encoding: str = "utf-8") -> str:
    file_path = Path(path)
    if not file_path.is_file():
        raise FileNotFoundError(f"文件不存在: {file_path}")
    return file_path.read_text(encoding=encoding)


def write_text(path: str | Path, content: str, encoding: str = "utf-8") -> None:
    file_path = Path(path)
    file_path.parent.mkdir(parents=True, exist_ok=True)
    file_path.write_text(content, encoding=encoding)

这两个函数的输入和输出都很明确:读取失败就抛出带路径的异常,写入前自动创建父目录。项目如果要求原子写入,还可以先写临时文件,再使用 Path.replace() 替换目标文件。

网络请求:超时、状态和重试缺一不可

“能请求成功”不等于“适合放进生产”。最小封装至少要设置超时,并用状态检查把 4xx、5xx 响应交给调用方处理。这里用标准库 urllib,不额外引入依赖:

import json
from urllib.error import HTTPError, URLError
from urllib.request import Request, urlopen


def get_json(url: str, timeout: float = 10.0) -> dict:
    request = Request(url, headers={"Accept": "application/json"})
    try:
        with urlopen(request, timeout=timeout) as response:
            if response.status < 200 or response.status >= 300:
                raise RuntimeError(f"HTTP 状态异常: {response.status}")
            return json.loads(response.read().decode("utf-8"))
    except (HTTPError, URLError, TimeoutError) as exc:
        raise RuntimeError(f"请求失败: {url}") from exc

重试不能无条件循环。只对临时网络错误重试,并采用递增等待;鉴权失败、参数错误等 4xx 响应应该立即返回。调用第三方服务前,还要确认接口条款、速率限制和敏感数据范围。

数据处理:让输入、输出和空值可见

下面的函数把字典列表中指定字段转换成统一字符串,并过滤缺失值。它不假设字段一定存在,便于在导入 CSV 或 JSON 后先做一层清洗。

from collections.abc import Iterable, Mapping


def clean_rows(rows: Iterable[Mapping], field: str) -> list[str]:
    result: list[str] = []
    for row in rows:
        value = row.get(field)
        if value is None:
            continue
        text = " ".join(str(value).split())
        if text:
            result.append(text)
    return result

如果业务需要去重,先确认是否区分大小写、空格和全角字符,再决定使用 set 还是保序去重。清洗规则要写进测试,否则下一次改动很容易悄悄改变结果。

把片段提取成函数,再用最小测试守住边界

重复出现两次以上的逻辑,可以提取到 tools/ 模块;但提取前要先确认差异是否应该变成参数。一个小测试足以固定核心行为:

import unittest


class TestCleanRows(unittest.TestCase):
    def test_strip_and_skip_empty(self):
        rows = [{"name": "  Alice  "}, {"name": ""}, {}]
        self.assertEqual(clean_rows(rows, "name"), ["Alice"])


if __name__ == "__main__":
    unittest.main()

先跑测试,再把函数放进项目工具模块,是比“复制一份能跑的代码”更稳的复用方式。测试至少覆盖正常值、缺失值和异常输入三类情况。

从代码片段到可维护工具函数的演进流程

图:识别重复逻辑、提取参数、编写最小测试,再收入统一工具模块。

一个可持续维护的目录

project/
├── app.py
├── tools/
│   ├── __init__.py
│   ├── files.py
│   ├── http.py
│   └── data.py
└── tests/
    └── test_tools.py

片段进入目录后,建议补上函数注释、类型标注和变更记录。涉及外部服务的函数,把超时、重试次数和日志级别做成参数;涉及文件的函数,明确覆盖策略和编码。这样未来换实现时,业务代码不必跟着大面积修改。

什么时候不要继续堆片段

一次性脚本、学习练习和内部工具适合从片段开始。若代码开始共享状态、处理并发、写入关键数据或服务多个团队,就应该建立包结构、自动化测试和发布流程。网上的“代码大全”只能提供起点,不能替代依赖锁定、权限审查和真实环境验证。

把高频片段整理成小而稳定的函数,搜索成本会降低,代码审查也会更有依据;而对未验证的示例保留边界说明,才不会把复制粘贴变成新的故障来源。

本文转载于:互联网 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。