1. 程式人生 > >python pdfplumber用於pdf表格提取

python pdfplumber用於pdf表格提取

 1 import pdfplumber
 2 
 3 with pdfplumber.open('test.pdf') as pdf:
 4     #page_count = len(pdf.pages())
 5     p0 = pdf.pages[0]
 6     # 獲取文字,直接得到字串,包括了換行符【與PDF上的換行位置一致,而不是實際的“段落”】
 7     #print(p0.extract_text()) 
 8     # 獲取本頁全部表格,也可以使用extract_table()獲得單個表格
 9     for table in p0.extract_tables(): 
10 #得到的table是巢狀list型別,轉化成DataFrame更加方便檢視和分析 11 for line in table: 12 print(line) 13 14 #安裝ImageMagick,地址在下面 15 #http://docs.wand-py.org/en/latest/guide/install.html#install-imagemagick-on-windows
16 #https://blog.csdn.net/blmoistawinde/article/details/82051915