鍍金池/ 教程/ Python/ 提取URL地址
文本翻譯
提取URL地址
處理PDF
塊分類
搜索和匹配
大寫轉(zhuǎn)換
提取電子郵件地址
字符串的不變性
文本處理狀態(tài)機(jī)
雙字母組
閱讀RSS提要
單詞替換
WordNet接口
重新格式化段落
標(biāo)記單詞
向后讀取文件
塊和裂口
美化打印數(shù)字
拼寫檢查
將二進(jìn)制轉(zhuǎn)換為ASCII
文本分類
文字換行
頻率分布
字符串作為文件
約束搜索
詞干算法
符號(hào)化
同義詞和反義詞
過濾重復(fù)的字詞
刪除停用詞
Python文本處理教程
文字摘要
段落計(jì)數(shù)令牌
語料訪問
文字改寫
文本處理簡(jiǎn)介
處理Word文檔
Python文本處理開發(fā)環(huán)境
排序行

提取URL地址

通過使用正則表達(dá)式從文本文件實(shí)現(xiàn)URL提取。表達(dá)式在文本與模式匹配的任何位置獲取文本。 只有re模塊用于此目的。

我們可以將輸入文件包含一些URL并通過以下程序處理它以提取URL。 findall()函數(shù)用于查找與正則表達(dá)式匹配的所有實(shí)例。

輸入的文本文件

顯示的是下面的輸入文件。 其中包含幾個(gè)URL。

Now a days you can learn almost anything by just visiting http://www.google.com. But if you are completely new to computers or internet then first you need to leanr those fundamentals. Next
you can visit a good e-learning site like - https://www.yiibai.com to learn further on a variety of subjects.

現(xiàn)在,當(dāng)獲取上述輸入文件并通過以下程序處理它時(shí),我們得到所需的輸出,也就是從文件中提取出來URL地址。

import re

with open("path\url_example.txt") as file:
        for line in file:
            urls = re.findall('https?://(?:[-\w.]|(?:%[\da-fA-F]{2}))+', line)
            print(urls)

執(zhí)行上面示例代碼,得到以下結(jié)果 -

['http://www.google.com.']
['https://www.yiibai.com']

上一篇:文字摘要下一篇:約束搜索