PHP 的字符串处理,说简单也简单,说坑也不少。日常开发中,截取、查找、替换、去空格这几件事几乎是天天打交道,但稍不留神就会踩到 Unicode 编码、类型比较、性能陷阱这些老问题。下面把几个最常被问到的场景拆开聊聊,顺便给出一套稳妥的写法。

字符串截取用 substr(),但注意中文乱码
PHP 原生的 substr() 是按字节截取的,对 UTF-8 编码的中文来说,一个汉字占三个字节,直接截很容易把多字节字符切成两半,结果要么是乱码,要么是问号。实际项目中几乎没人敢直接用它处理中文,稳妥的做法是换成 mb_substr(),并且一定要显式传入编码参数:
mb_substr($str, 0, 10, 'UTF-8')
为什么强调“显式传入”?因为 mb_substr() 如果不传编码,会依赖 mb_internal_encoding() 的当前设置。这个内部编码很容易被其他模块或框架修改,本地开发环境可能没问题,一上线就乱码——这种坑不少团队都踩过。所以,'UTF-8' 直接写死是最省心的做法。
常见的错误现象:substr() 截出来出现“”或长度异常;mb_substr() 没传编码时本地正常、上线后乱码。遇到这类问题,优先检查编码参数是否硬编码。
查找位置别只用 strpos(),小心返回 0 和 false 的混淆
strpos() 这个函数有个经典陷阱:如果匹配的内容刚好在字符串开头,它返回 0;如果没找到,返回 false。但 PHP 的弱类型比较里,0 == false 是成立的。所以直接写 if (strpos($str, 'abc')) 这种判断,当 abc 出现在开头时,条件就被当成 false 跳过了,逻辑直接出问题。
正确的写法是严格比较:
strpos($str, 'abc') !== false—— 判断是否存在strpos($str, 'abc') === 0—— 判断是否在开头
如果项目已经用上 PHP 8.0+,更推荐直接用 str_contains(),语义清晰,没有类型陷阱。低版本的话,也可以用 stripos() 配合 !== false 组合,注意大小写敏感问题。
替换操作优先选 str_replace(),正则留到真需要时再上
90% 的替换场景——比如批量改关键词、清除空格、统一换行符——用 str_replace() 就够了。它的执行速度比 preg_replace() 快 3 到 5 倍,而且没有 PCRE 引擎的额外开销,也不用担心转义字符带来的麻烦。
说几个典型的误用场景:
- 想清空多余空白,有些人直接用
preg_replace('/\s+/', ' ', $str)。其实用多次str_replace()或者配合preg_replace_callback()更可控,也更稳定。 - 替换固定字符串却写成了正则模式,比如
preg_replace('/\.php$/', '.html', $url)。直接str_replace('.php', '.html', $url)就能搞定,还不用担心正则边界问题。
只有当需要“模糊匹配”时——比如提取邮箱、格式化手机号——才上正则。否则,用正则只会增加维护成本和运行风险。
trim() 默认只去 ASCII 空白,中文全角空格得手动加
trim() 默认处理的是 ASCII 空白字符,包括 " \t\n\r\0\x0B"。但对中文全角空格( )、不间断空格( )、零宽空格等完全无效。很多新手在这里栽过跟头——测试时用英文空格一切正常,一上线遇到中文用户输入,发现“ 用户名”看着像空格,实际查询时死活匹配不上。
实操建议:
- 清理用户输入时,先
str_replace([' ', ' '], ' ', $str),再trim()。 - 如果想兼容所有可见的空白类字符,可以用
preg_replace('/[\s\x{3000}]+/u', ' ', $str)配合trim()。 - 数据库入库前务必做这步处理,否则全角空格导致的“假空格”会让查询结果凭空消失。
这个点特别容易被忽略,但一旦出现,排查起来非常头疼。提前做好防范,比事后追查要省心得多。