影刀RPA文本数据提取方法三:指令提取
影刀RPA文本数据提取方法三:指令提取
作者:林焱 | 适合人群:不会正则也不会JSON,但需要用影刀内置指令处理文本的新手
什么情况用什么
你从网页上抓了一段文本,要从中提取特定内容,但不会写正则,数据也不是JSON格式。
影刀RPA提供了一组文本处理指令,可以不用写代码就完成大部分文本提取任务。
什么情况用指令提取:
- 要提取的内容有固定前缀或后缀(比如"价格:99元"里的"99")
- 要做字符串替换、拼接、截取
- 要判断文本是否包含某个关键词
- 你不会正则,也不想学
怎么做
核心指令一览
| 指令 | 功能 | 例子 |
|---|---|---|
| 查找文本 | 返回关键词在字符串里的位置 | 找"价格:"的位置 |
| 截取文本 | 按位置截取一段字符串 | 从第5个字符开始取10个 |
| 替换文本 | 把A替换成B | 把"¥"替换成"" |
| 分割文本 | 按分隔符切成列表 | 按",“分割"a,b,c” |
| 去除空白字符 | 去掉首尾空格 | 清洗用户输入 |
案例1:提取"价格:99元"里的数字
步骤:
- 「查找文本」→ 在"价格:99元"里找":"的位置 → 返回2
- 「查找文本」→ 找"元"的位置 → 返回5
- 「截取文本」→ 从第3个字符开始,取2个字符 → “99”
拼多多店群自动化报活动上架!
更简单的做法:
5. 「替换文本」→ 把"价格:“替换成”" → “99元”
6. 「替换文本」→ 把"元"替换成"" → “99”
案例2:从URL里提取参数值
URL:"https://www.taobao.com/item.htm?id=123456&type=normal"
目标:提取id参数的值123456
步骤:
- 「分割文本」→ 按"?"分割 → 取后面一段:
"id=123456&type=normal" - 「分割文本」→ 按"&"分割 → 取第一段:
"id=123456" - 「分割文本」→ 按"="分割 → 取第二段:
"123456"
案例3:批量清洗手机号(去掉空格和横线)
文本列表:["138 0013 8000", "139-0013-9000", "13800138000"]
用「ForEach」循环,每次处理一个:
- 「替换文本」→ 替换空格成""
- 「替换文本」→ 替换横线成""
- 保存到清洗后的列表
有什么坑
坑1:查找文本返回的位置是从0开始还是从1开始
影刀的「查找文本」指令,返回的位置是从1开始的(不是从0)。
比如"价格:99元","价"的位置是1,“格"是2,”:"是3。
如果你用其他语言(比如Python)处理文本,位置是从0开始的。两边混用时要注意。
坑2:截取文本的位置和长度要算清楚
「截取文本」指令有两个参数:
- 起始位置(从1开始)
- 截取长度
如果你想取"价格:99元"里的"99":
- 起始位置:4(“价”=1,“格”=2,“:”=3,所以数字从4开始)
- 截取长度:2
如果截取到末尾,长度参数可以填一个很大的数(比如9999),影刀会自动截取到末尾。
坑3:分割文本后,取某一段要注意索引
「分割文本」返回的是一个列表。
比如"a,b,c"按","分割成["a","b","c"]。
取第一段:分割结果[0](影刀里列表索引从0开始)
取最后一段:分割结果[分割结果.size-1]
TEMU店群矩阵自动化运营核价报活动
坑4:替换文本是区分大小写的
「替换文本」指令默认区分大小写。
比如把"apple"替换成"banana",不会匹配"Apple"或"APPLE"。
如果不想区分大小写,需要先「转小写」或「转大写」,再做替换。
坑5:去除空白字符只去掉首尾,中间的去不掉
「去除空白字符」指令只去掉字符串开头和结尾的空格、换行、Tab。
中间的空格去不掉。如果想去掉所有空格,用「替换文本」把空格替换成空字符串。
总结
指令提取适合简单的、格式固定的文本处理任务。如果格式不固定(比如价格有时是"99元",有时是"¥99.00"),还是要用正则或Python。
三种文本提取方法怎么选:
- 格式固定 → 用指令提取(最简单)
- 有固定模式但不固定格式 → 用正则提取(最灵活)
- 数据在JSON里 → 用JSON解析(最快)
下一篇讲文本数据提取方法四:Python字符串处理,应对那些指令和正则都搞不定的复杂场景。
作者:林焱
