在php开发中,把一段长文本切分成固定数量的段落是一个常见需求,比如做文章摘要预览、移动端分页展示或语音播报分句。很多初学者会直接用substr按字符数截断,结果经常把一个词或句子拦腰切断,阅读体验很差。其实更高效的做法是先把文本拆成小的语义单元,再利用array_chunk按指定段数均匀分组,最后拼装成段落。

为什么不用substr而用array_chunk
substr只能从字符维度截取,完全不理解文本结构。假设有一段三百字的中文,用substr每五十字切一刀,第十个字可能正好落在“我们”的“们”后面,下一刀从“的”开始,语义完全破碎。而array_chunk操作的是数组,只要我们提前把文本按句子或换行拆成数组元素,它就能把元素尽量平均地放进指定数量的桶里。
array_chunk是php内置函数,签名是array_chunk(array $array, int $length, bool $preserve_keys = false)。它的第二个参数length表示每个块的元素个数,而不是字节数。当我们想分成N段时,可以用count算出每段的句子数,再交给array_chunk处理,逻辑清晰且无需自己写循环边界判断。
基础实现:按换行拆分再分块
最直观的场景是用户提交的带换行文本。我们可以先用explode按换行符拆成数组,再根据目标段数计算每块行数。下面示例把文本分成3段:
<?php
$text = "第一行内容n第二行内容n第三行内容n第四行内容n第五行内容n第六行内容";
$lines = explode("n", $text);
$total = count($lines);
$segCount = 3;
$per = (int)ceil($total / $segCount);
$chunks = array_chunk($lines, $per);
$result = array_map(function($item){
return implode("n", $item);
}, $chunks);
print_r($result);
?>
上面的代码先按换行拆出6行,目标3段,ceil(6/3)=2,于是array_chunk每2行一组,得到3个块,再用implode还原成带换行的段落。这种方式简单可靠,适合日志、歌词等本身就有换行结构的内容。
如果最后一块不足per行,array_chunk会自动把剩余元素放进最后一个块,不会报错也不会丢弃数据,这正是它比手动for循环省心的地方。你不需要判断余数,也不用处理空数组。
进阶技巧:按句子拆分保持语义
很多网页文本是一整段没有换行,这时用换行拆分会失效。我们可以用preg_split按句号、问号、感叹号拆句,再分块。这样每段都是由完整句子组成,不会断句。
<?php
$text = "今天天气真好。我们去公园散步?孩子非常开心!晚上准备吃火锅。明天还要上班。时间过得太快了。";
$sentences = preg_split('/([。?!])/u', $text, -1, PREG_SPLIT_DELIM_CAPTURE);
// 合并标点回句子
$real = array();
for ($i = 0; $i < count($sentences); $i += 2) {
$real[] = $sentences[$i] . ($sentences[$i+1] ?? '');
}
$segCount = 2;
$per = (int)ceil(count($real) / $segCount);
$chunks = array_chunk($real, $per);
$paragraphs = array_map(function($item){
return implode('', $item);
}, $chunks);
print_r($paragraphs);
?>
这里用PREG_SPLIT_DELIM_CAPTURE把标点也捕获出来,再两两拼回,保证句子结尾符号不丢失。分2段时,6个句子每3个一组,得到两个语义完整的段落。相比强行按字数截,这种方法在内容平台上能显著降低读者跳读率。
要注意preg_split的u修饰符不能少,否则中文标点可能被当作单字节处理导致乱码。若文本含英文句点,可把正则改为'/([。?!.]) /u'并相应调整合并逻辑。
限制段数的封装函数
为了复用,可以封装一个split_text_to_segments函数,接收文本、目标段数和拆分模式。内部自动判断用换行还是句子,并返回段落数组。
<?php
function split_text_to_segments($text, $segCount = 3, $mode = 'sentence') {
if ($mode === 'line') {
$units = explode("n", $text);
} else {
$tmp = preg_split('/([。?!])/u', $text, -1, PREG_SPLIT_DELIM_CAPTURE);
$units = array();
for ($i = 0; $i < count($tmp); $i += 2) {
$units[] = $tmp[$i] . ($tmp[$i+1] ?? '');
}
}
$units = array_filter($units, function($v){ return trim($v) !== ''; });
$units = array_values($units);
$per = (int)ceil(count($units) / $segCount);
if ($per < 1) $per = 1;
$chunks = array_chunk($units, $per);
return array_map(function($item){
return implode($mode === 'line' ? "n" : '', $item);
}, $chunks);
}
$demo = "春眠不觉晓。处处闻啼鸟。夜来风雨声。花落知多少。";
$out = split_text_to_segments($demo, 2, 'sentence');
print_r($out);
?>
这个函数先过滤空单元,避免空段;array_values重置索引让array_chunk更稳定;mode参数切换拆分维度。实际项目中,你还可以加入最大段长保护,防止某段句子过多时仍超限。
使用array_chunk的核心优势是代码量少、语义明确。它把“分组”这一通用操作交给语言内置实现,我们只需关心“怎么拆”和“怎么拼”,整体可维护性比一堆if-else的循环好很多。
常见误区与注意点
有人误以为array_chunk的第二个参数是总段数,其实它是每段的单元数。要实现指定段数,必须自己用总数除以目标段数并向上取整。另一个误区是直接在array_chunk后count判断段数,若单元数不能被整除,段数可能比预期少,因此用ceil是必要的。
当文本极短,比如只有一句话,目标段数设成5,ceil(1/5)=1,array_chunk每1句一组,最终只返回1段。这是合理行为,强行补空段反而浪费渲染资源。若业务要求必须填满N段,可在后面用空字符串补齐数组再分块。
| 方法 | 优点 | 缺点 |
|---|---|---|
| substr截断 | 写法简单 | 断词断句,体验差 |
| explode+array_chunk按行 | 逻辑清晰,保结构 | 依赖原文本有换行 |
| preg_split+array_chunk按句 | 语义完整,通用性强 | 正则稍复杂,需处理标点 |
总体来看,php分割文本到指定数量段时,array_chunk是非常实用的拼图零件。配合合理的拆分前置处理,就能用十几行代码稳健地完成大多数排版类需求。
phparray_chunk文本分割修改时间:2026-08-03 05:24:32