ICode9

精准搜索请尝试: 精确搜索
首页 > 其他分享> 文章详细

获取word内容中的发文时间及发文单位页码等

2021-07-29 12:58:45  阅读:313  来源: 互联网

标签:word 单位 获取 xx 发文 页码


获取word内容中的发文时间及发文单位页码等

软件下载地址在 下载软件https://gitee.com/ztwenxing/open/blob/master/getwordcontent.exe

如果你觉得可以用的话,可以分享给你朋友!!有什么好的建议亦可以在下方留言或发邮件交流ztwenxing@dingtalk.com!!(非专业人士制作,有的系统环境不一定能使用,见谅。)

对于正在整理各种档案的你一定有所帮助!配合bat使用ren old_name new_name快速实现档案目录的编写工作!!!

主要用途

- 从word文件或者是文字类pdf文件中获取发文单位和发文时间

- 获取每个文档的页码,用于后面的档案目录编写

环境要求

- 目前可以用的是Windows 64位系统

- 必须装有wps或者office软件

实现原理

- python获取word或者pdf内容,然后通过正则表达式获取对应的发文单位、发文号、发文时间、以及每个文档的页码。

- 获取发文单位和发文时间优先级为文件最后一行“XXX单位 xxxx年xx月xx日印发”;其次通过正常落款格式“xxxx单位 xxxx年xx月xx日”;最后通过对比全文中找到的日期的最大获取发文时间;
- 获取发文号的标准格式如“国办发〔1996〕2号”
- PDF为图片格式转换而来的,暂不支持获取相应的内容

标签:word,单位,获取,xx,发文,页码
来源: https://blog.csdn.net/ky200904020/article/details/119208636

本站声明: 1. iCode9 技术分享网(下文简称本站)提供的所有内容,仅供技术学习、探讨和分享;
2. 关于本站的所有留言、评论、转载及引用,纯属内容发起人的个人观点,与本站观点和立场无关;
3. 关于本站的所有言论和文字,纯属内容发起人的个人观点,与本站观点和立场无关;
4. 本站文章均是网友提供,不完全保证技术分享内容的完整性、准确性、时效性、风险性和版权归属;如您发现该文章侵犯了您的权益,可联系我们第一时间进行删除;
5. 本站为非盈利性的个人网站,所有内容不会用来进行牟利,也不会利用任何形式的广告来间接获益,纯粹是为了广大技术爱好者提供技术内容和技术思想的分享性交流网站。

专注分享技术,共同学习,共同进步。侵权联系[81616952@qq.com]

Copyright (C)ICode9.com, All Rights Reserved.

ICode9版权所有