当前位置:主页 > 查看内容

python批量管理文献

发布时间:2021-04-22 00:00| 位朋友查看

简介:目前硕士搬砖老师给了个任务下载700篇相关文献并且把每篇文献按照 *年份-期刊名称-文章题目* 格式来重命名未处理之前如图 处理完成之后如图 对于700篇的文献整理每一篇要依次点开寻找对应 “ 年份 期刊名称 文章题目 ” 这个工作量显然是灾难 且重复操作没有……
   目前硕士搬砖,老师给了个任务,下载700篇相关文献,并且把每篇文献按照  *年份-期刊名称-文章题目* 格式来重命名,未处理之前如图:

在这里插入图片描述

处理完成之后如图:
在这里插入图片描述
对于700篇的文献整理,每一篇要依次点开,寻找对应 “年份 期刊名称 文章题目” ;这个工作量显然是灾难, 且重复操作没有营养,想写一个程序自动完成。

第一步:获取每一篇文献的相关信息。若用程序直接读取pdf文件,寻找信息是相当困难的,因为我的这700篇文献中“年份 期刊名称 文章题目”出现位置极不规律,可以说一篇一个样,随便贴两张图:
在这里插入图片描述
在这里插入图片描述
可以看出,*“年份 期刊名称 文章题目”*出现很不一样,无法通过一种固定的方法获取,在“哥们”的帮助之下,获得了一个神奇的软件:Zotero,下载链接(https://www.zotero.org/download/),把文章导入之后可以自动获得一系列信息,如图:

在这里插入图片描述
通过导入的操作,可以获得每一篇的相关信息,此软件可以将这些信息输出为.csv文件,如图:
在这里插入图片描述
第二步:从这里选择需要的信息,然后再通过python代码,就可以批量命名啦,源程序直接上:

import os,csv
path = "C:/Users/e2164\Desktop/2"+"/"  #文献文件所在位置
new_name = csv.reader(open(r'C:\Users\e2164\Desktop\wenxin.csv', encoding='utf-8'))  #导出的excel文件所在位置
New=[]
for i in new_name: #获取表格想要信息,我这里选择的是  “年份 期刊名称 文章题目“
    name=i[0]+'-'+i[1]+'-'+i[2]  #这是把这些信息整合在一起
    New.append(name)
print('导入完成')
# 获取该目录下所有文件,存入列表中
f = os.listdir(path)
print(len(f))

print(f[0])

n = 0
i = 0
j = 1
for i in f:
    # 设置旧文件名(就是路径+文件名)
    oldname = f[n]

    # 设置新文件名
    newname = New[n]+'.pdf'
    # 用os模块中的rename方法对文件改名
    try:
        os.rename(path+oldname, path+newname)
        print(oldname, '======>', newname)  #命名成功的
    except:
        os.rename(path + oldname, path + 'error'+str(j)+'.pdf')
        print(j)
        j += 1   #命名失败的

    n += 1

注意:
1、有些文献的题目中含有“/ \ < > * ? : ”,这样的字符是不允许出现的,所以在表格中把这些符号预先替换掉,从而大大提高成功率。
2、excel文件中的文献排列顺序要和文献文件顺序排列一致,否则出现“张冠李戴”。

;原文链接:https://blog.csdn.net/hjuihui/article/details/115413158
本站部分内容转载于网络,版权归原作者所有,转载之目的在于传播更多优秀技术内容,如有侵权请联系QQ/微信:153890879删除,谢谢!
上一篇:Python概述 下一篇:没有了

推荐图文


随机推荐