


下載本文檔
版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)
文檔簡(jiǎn)介
第python從PDF中提取數(shù)據(jù)的示例前言
數(shù)據(jù)是數(shù)據(jù)科學(xué)中任何分析的關(guān)鍵,大多數(shù)分析中最常用的數(shù)據(jù)集類型是存儲(chǔ)在逗號(hào)分隔值(csv)表中的干凈數(shù)據(jù)。然而,由于可移植文檔格式(pdf)文件是最常用的文件格式之一,因此每個(gè)數(shù)據(jù)科學(xué)家都應(yīng)該了解如何從pdf文件中提取數(shù)據(jù),并將數(shù)據(jù)轉(zhuǎn)換為諸如csv之類的格式,以便用于分析或構(gòu)建模型。
在本文中,我們將重點(diǎn)討論如何從pdf文件中提取數(shù)據(jù)表。類似的分析可以用于從pdf文件中提取其他類型的數(shù)據(jù),如文本或圖像。我們將說明如何從pdf文件中提取數(shù)據(jù)表,然后將其轉(zhuǎn)換為適合于進(jìn)一步分析和構(gòu)建模型的格式。我們將給出一個(gè)實(shí)例。
02
示例:使用Python從PDF文件中提取一個(gè)表格
a)將表復(fù)制到Excel并保存為table_1_raw.csv
數(shù)據(jù)以一維格式存儲(chǔ),必須進(jìn)行重塑、清理和轉(zhuǎn)換。
b)導(dǎo)入必要的庫(kù)
importpandasaspd
importnumpyasnp
c)導(dǎo)入原始數(shù)據(jù),重新定義數(shù)據(jù)
df=pd.read_csv(table_1_raw.csv,header=None)
df.values.shape
df2=pd.DataFrame(df.values.reshape(25,10))
column_names=df2[0:1].values[0]
df3=df2[1:]
df3.columns=df2[0:1].values[0]
df3.head()
d)使用字符串處理工具進(jìn)行數(shù)據(jù)糾纏
我們從上面的表格中注意到,x5、x6和x7列是用百分比表示的,所以我們需要去掉percent(%)符號(hào):
df4[x5]=list(map(lambdax:x[:-1],df4[x5].values))
df4[x6]=list(map(lambdax:x[:-1],df4[x6].values))
df4[x7]=list(map(lambdax:x[:-1],df4[x7].values))
e)將數(shù)據(jù)轉(zhuǎn)換為數(shù)字形式
我們注意到列x5、x6和x7的列值數(shù)據(jù)類型為string,因此我們需要將它們轉(zhuǎn)換為數(shù)值數(shù)據(jù),如下所示:
df4[x5]=[float(x)forxindf4[x5].values]
df4[x6]=[float(x)forxindf4[x6].values]
df4[x7]=[float(x)forxindf4[x7].values]
f)查看轉(zhuǎn)換數(shù)據(jù)的最終形式
df4.head(n=5)
g)導(dǎo)出最終數(shù)據(jù)到一個(gè)csv文件
df4.to_csv(table_1_final.csv,index=Fal
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 人人文庫(kù)網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。
最新文檔
- 同濟(jì)食堂管理辦法
- 后備人才管理辦法
- 員工停車管理辦法
- 唐山樓盤管理辦法
- 商業(yè)牌匾管理辦法
- 商葉云貸管理辦法
- 商城系統(tǒng)管理辦法
- 商混資質(zhì)管理辦法
- 四新準(zhǔn)入管理辦法
- 團(tuán)隊(duì)加分管理辦法
- 中國(guó)古代對(duì)雷的認(rèn)知與探索
- 2025年管理學(xué)基礎(chǔ)試題庫(kù)及答案
- 2025年上海租房合同范本下載
- 《習(xí)作即景》教學(xué)課件
- 胃腸疾病健康科普教育
- 2025至2030全球及中國(guó)汽車48V系統(tǒng)行業(yè)產(chǎn)業(yè)運(yùn)行態(tài)勢(shì)及投資規(guī)劃深度研究報(bào)告
- 德勤:2025“十五五”時(shí)期中國(guó)能源行業(yè)關(guān)鍵議題報(bào)告
- 低碳經(jīng)濟(jì)視域下陜西省能源產(chǎn)業(yè)的轉(zhuǎn)型與發(fā)展:挑戰(zhàn)、機(jī)遇與策略研究
- 煤礦資金計(jì)劃管理辦法
- 2025年小學(xué)數(shù)學(xué)教師招聘考試模擬試卷及答案
- 房地產(chǎn)企業(yè)土地增值稅清算代理服務(wù)合同
評(píng)論
0/150
提交評(píng)論