Skip to content

Instantly share code, notes, and snippets.

@bergpb
Created March 12, 2019 18:32
Show Gist options
  • Select an option

  • Save bergpb/ce5e3cf3771f904c75c5be7d6747478d to your computer and use it in GitHub Desktop.

Select an option

Save bergpb/ce5e3cf3771f904c75c5be7d6747478d to your computer and use it in GitHub Desktop.
import sys
import time
import PyPDF2
import shutil
from pdfrw import PdfReader, PdfWriter
file = sys.argv[1]
get_name_file = file.split('.')
pdfFileObj = open(file, 'rb')
pdfReader = PyPDF2.PdfFileReader(pdfFileObj)
num_pages = pdfReader.getNumPages()
print (num_pages)
def extractPages():
print('Extraindo txt das paginas...\nAguarde, essa etapa pode demorar um pouco\n')
for page in range(1, num_pages+1):
pdfFileObj = open(file, 'rb')
pdfReader = PyPDF2.PdfFileReader(pdfFileObj)
file_txt = open(get_name_file[0]+'.txt', 'a')
pageObj = pdfReader.getPage(page)
print('Extraindo pagina {}'.format(page))
pageObj_ = pageObj.extractText().strip()
file_txt.write((pageObj_+'\n').encode("utf-8"))
file_txt.close()
print('---Texto extraido---\n')
extractPages()
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment