数据整理最耗时间的环节往往不是录入,而是从一大段混杂的文本里把有用的部分抠出来。比如客服反馈表里客户随手写的“张三 13800138000 下周三上门”,项目群里成员汇报的进度信息,或者从其他系统导出的地址清单,这些内容如果没有结构化,后续的筛选、统计都无从谈起。飞书多维表格除了当存储表用,其实内置了一套相当完整的文本处理能力,配合公式字段和自动化流程,完全可以把它当成一个轻量级的信息加工平台。这篇文章就围绕几个典型场景,把提取关键信息的常用方法讲清楚。

用公式字段和文本函数做基础提取
多维表格的字段类型里有一种“查找公式”字段,它是做信息提取的核心入口。新建字段时选择查找公式,就可以在编辑器里写表达式,对同一行的其他字段做计算,提取结果会实时更新。最常用的几个函数是LEFT、MID、FIND和LEN,它们组合起来能完成大部分定界符场景的截取任务。
举个例子,假设原始数据是“张三-销售部-13800138000”这样的格式,想拆出姓名和手机号,可以按分隔符的位置来截。姓名在第一个横杠之前,用LEFT(原始字段, FIND("-", 原始字段)-1)即可;手机号在最后一个横杠之后,思路是先算出文本总长度,再找到分隔符位置,用MID从分隔符后一位开始截取。下面是完整的公式写法:
姓名提取:
LEFT([原始文本], FIND("-", [原始文本]) - 1)
手机号提取(以最后一个"-"为界):
MID([原始文本],
FIND("-", [原始文本], LEN([原始文本]) - 14) + 1,
20)
部门提取(取两个"-"之间的内容):
MID([原始文本],
FIND("-", [原始文本]) + 1,
FIND("-", [原始文本], FIND("-", [原始文本]) + 1) - FIND("-", [原始文本]) - 1)
这种基于固定分隔符的方法优点是稳定、可预期,只要数据格式不乱,公式基本不需要维护。缺点也很明显:一旦数据来源格式不统一,比如有的用横杠有的用空格,公式就会报错或返回错误结果。因此在设计表结构时,建议先用一个独立的“原始文本”字段承接杂乱数据,再另建多个公式字段分别输出提取结果,这样即使公式出错,原始数据也不会被污染,排查问题也只需要盯公式字段。
用正则表达式应对格式不固定的文本
如果文本格式不那么规整,固定位置的截取就不好使了。比如一段备注里写着“客户李四来电,号码13800138001,希望周五下午处理”,姓名和手机号的位置每次都不一样,这时候多维表格支持的REGEX系列函数就派上用场了。REGEX_EXTRACT可以从文本中匹配出第一个符合正则模式的内容,而REGEX_REPLACE则可以把匹配到的部分替换掉,两者配合几乎能应付所有非结构化文本的提取需求。
拿上面那段备注来说,手机号是连续11位数字,可以用模式[0-9]{11}直接匹配;日期类信息如“周五”“3月15日”可以针对性写模式;中文名字常见为两到四个汉字,在文本比较干净的前提下用[\u4e00-\u9fa5]{2,4}也能粗略抓取。下面给几个常用模式:
提取11位手机号:
REGEX_EXTRACT([备注], "[0-9]{11}")
提取第一个中文名字:
REGEX_EXTRACT([备注], "[\u4e00-\u9fa5]{2,4}")
提取金额(数字可含小数点):
REGEX_EXTRACT([备注], "[0-9]+\.?[0-9]*元")
去掉文本中所有空白字符:
REGEX_REPLACE([备注], "\s", "")
正则的威力大,但书写门槛也相对高一点。实际使用中有两个经验值得注意:一是模式宁可写严格一点也不要太宽松,比如手机号如果直接用[0-9]+,很可能把订单号也抓进来,限定长度为11位能过滤掉大部分干扰;二是提取出来的结果建议再做一层校验,比如手机号字段可以用LEN判断长度是否为11,不满足的标记出来人工复核,这样比事后发现数据错了再返工省事得多。
借助自动化流程和AI字段实现批量智能处理
公式解决的是“怎么提取”,自动化流程解决的是“什么时候提取”。多维表格的自动化能力可以在新增记录、字段内容变更等事件触发时自动执行动作,比如把群消息、表单提交自动写入表格,再由公式字段即时完成拆解,整条链路不需要人守着。配置时先设定触发器为“当收到表单提交”或“当新增记录”,动作选择修改当前记录或发送通知,就能实现新数据进来自动加工、异常数据自动提醒。
对于连正则都难以覆盖的场景,比如语义层面的信息抽取——从一段长描述里判断客户情绪、总结需求要点、提取多个地址中的城市名——可以考虑多维表格的AI字段能力。在字段配置里选择AI相关类型后,用自然语言写一句指令,例如“从该文本中提取提到的产品名称,用顿号分隔,没有则留空”,AI字段就会对每行数据执行这个指令并填入结果。它的优势是不需要琢磨文本格式,缺点是结果存在不确定性,关键业务字段最好保留人工确认环节。一个比较稳妥的分工是:格式规整的数据交给公式,格式松散但有明确特征的数据交给正则,语义模糊的数据交给AI,三类字段各司其职。
最后再提一点字段设计上的建议:提取出来的字段尽量单独建列并选择合适的字段类型,手机号设成文本类型避免数字前导零丢失,日期提取结果设成日期类型以便后续做日历视图和分组统计。原始数据、规则提取、智能提取分三层摆放,表格整体会清晰很多,后期维护公式的成本也会低不少。把这套思路跑通之后,多维表格就不再只是一张表,而是一个随取随用的信息处理流水线。