利用python3查找文件夹内所有文件内容

学习wp主题的时候看到了几个自定义的action,因为主题文件较多,随手点了几个都不对,逐渐红温,忽然想起来python可能会有对应的模块吧,毕竟“人生苦短,我用python”嘛。

利用python3查找文件夹内所有文件内容

要说ai搜索这东西,方便确实是方便,一搜索直接把示例程序也给提供了,稍微修改一下就直接可以运行,但对于自己做内容的小站点来说,就不那么友好了,人为刀俎我为鱼肉,最终沦为了“搜索资源”与“训练物料”。可能是博主的python版本较低的原因,在print的时候没法加f前缀直接在引号内打印变量,所以老老实实用+号连接了。

利用python3查找文件夹内所有文件内容

import os

def search_directory_content(directory):
    for root, dirs, files in os.walk(directory):
        for file in files:
            file_path = os.path.join(root, file)
            with open(file_path, 'r') as f:
                content = f.read()
                # 在这里添加你的搜索逻辑,例如:
                if 'zakra_action_after_content' in content:
                    print("Found in " + file_path)
                    
# 调用函数
search_directory_content('./zakra')

运行程序后,很快就得到了结果。

利用python3查找文件夹内所有文件内容

python3的错误信息

在公司电脑上跑得好好的程序,回家跑的时候报了这样一个错误。其原因是含有无法编码的字符;

UnicodeDecodeError: 'gbk' codec can't decode byte 0xff in position 0: illegal multibyte sequence

附上修改后的代码:

import os

def search_directory_content(directory):
    for root, dirs, files in os.walk(directory):
        for file in files:
            file_path = os.path.join(root, file)
            with open(file_path, 'r',encoding='gb18030',errors='ignore') as f:
                content = f.read()
                # 在这里添加你的搜索逻辑,例如:
                if 'add_theme_support' in content:
                    print("Found in " + file_path)
                    
# 调用函数
search_directory_content('./zakra')

关于gb18030的小贴士

GB18030是中国制定的汉字集编码规则的国际标准,想要更好的了解这套标准需要清除的知道其演化过程:

1980年,GB2312—80(我国的第一套汉字集标准),共包含7445个字符,其中6763个常用汉字;1995年,GBK,由GB2312—80(和港、台两种标准)扩展而来,共包含21886个字符,其中常用汉字14240个。GB2312—80和GBK都只包含一个字节和双字节汉字,直到GB18030—2000产生,汉字标准字符集继续扩展,又增加了6351个字符,其中一部分为4字节字(four-byte encoding range)。目前最新的国家汉字标准是GB18030—2005,在上述基础上又增加了六种少数民族语言和一些四字节字。

在Unicode产生之前,各国的标准基本都是各自为主,自己制定自己的那一套,谁也不服谁,彼此之间不通用,也别想着转换,由于历史原因,汉字就相对复杂,有三套标准共存,GB2312—80是中国大陆的,Big5是中国台湾的,HKSCS是中国香港的。这三套标准并不通用,彼此的编码在底层没办法转换。那个年代只要写出一套能够在桌面显示简体和繁体的软件就可以卖大钱。

其实这种混论并不局限于国内,在世界范围来说也非常的不利于文化交流。值得一提的是,进过每个国家都有自己的标准,但是所有的便准的制定都是在ASCII的基础上的,这也一定程度上为Unicode的诞生和标准化奠定了基础。

乱不能久,统一才是大趋势,于是Unicode应运而生,在Unicode诞生后,建立与其上的GBK和GB18030称为汉字的国际标准,结束了汉字有三套标准的混乱局面。GB18030是GBK的超集,也就是包含的字符要比GBK多。不过像微软的windows口和一些公司的Linux系统中的内嵌的中文编码都是GBK。其实GB18030比GBK中多出来的字符不是很常用,里面包含的主要是一些少数民族语言和一些韩语和维族语言。

标签: python

移动端可扫我直达哦~

推荐阅读

thumbnail 2026-01-08

让python程序后台运行的方案

前台运行的程序影响了服务器的使用,但又希望该程序能一直运行,所以就考虑在后台跑这个PYTHON服务。使用&在Linux/Mac终端后台运行python your_script.py &程序会在后台运行按回车返回终端使用jobs...

建站相关 python

thumbnail 2025-12-27

利用python批量下载图片

在贴吧找到一组图片,记录了皇骑隐藏宝物的地址,但手机端访问的时候总是提示要求下载贴吧的app,博主用的64g内存的手机,光一个千牛就占了12g,实在没有太多空间来安装多余的app,所以就想把图片转载到自己的博客上。首先是审查元素提取图...

少儿编程 python

thumbnail 2025-10-09

python扫描电话手表的开放端口

手头上有台闲置的米兔2S电话手表,固件版本是T13开头的,想看看ip地址有没有什么端口是开放便于调试的,所以利用python扫了一下,程序利用deepseek生成,结果扫一遍下来用了10分钟,答案是一个端口也没有开放:import s...

少儿编程 python

thumbnail 2025-10-09

PYTHON 通过按键来中止循环程序运行

用python实现了一个类似按键精灵的功能,在一个可修改的pdf里依次输入序列号并打印,序列号多的时候结束程序很难被点到,所以想设置一个快捷键来中止程序。程序基与python 2.7.18, 需要调用 keyboard 库,如果没有的...

少儿编程 python

thumbnail 2025-07-23

利用python2.7.18解密pdf文件

之前介绍过在线移除pdf密码的方式,但在线的方式多少有些安全隐患,而且当pdf过大时,下载的速度也堪忧。所以就补充一个利用python来解密的方案。博主的python版本是python2.7.18。解密需要用到python的PyPDF...

少儿编程 python

thumbnail 2025-07-03

利用python拆分本地pdf文件的方法

之前分享过利用在线文件格式转换工具来拆分PDF文件的方法,昨天遇到一个尴尬的问题,利用在线转换的时候,上传速度很快,拆分也没有报错,然而拆分后的压缩包总计32M,而下载速度却只有可怜的30k,这就有点不能忍了。于是在下载进度条第一次报...

少儿编程 python

thumbnail 2025-03-29

利用python压缩扫描图片格式的pdf文件

扫描了一份52页的银行流水,需要提交到某个网站,但该站点限制最大文件不超过10M,博主的扫描件大小总计38M,用夸克浏览器扫描得到,即便选择瘦身模式,最终的大小也超过了30M。之前有找过压缩pdf的在线站点,博主在博客内也有提及,有兴...

少儿编程 python

thumbnail 2024-06-28

python中print函数的格式控制符号

%字符:标记转换说明符的开始;转换标志:- 表示左对齐;+ 表示在转换值之前要加上正负号;“” (空白字符)表示正数之前保留空格;0表示转换值若位数不够则用0填充;最小字段宽度:转换后的字符串至少应该具有该值指定的宽度。如果是*,则宽...

少儿编程 python

thumbnail 2024-06-27

小鸟数据python语法速查表

Python对大小写敏感,使用半角符号,变量命名采用“_”、数字或字母的组合,建议采用规范的命名方式,比如使用驼峰式命名方式,编程过程中多写注释。基础语法数据类型:整数,浮点,字符串,逻辑值运算符号:+,-,*,/, % , // ,...

少儿编程 python