1. 程式人生 > >網路爬蟲中Jsoup請求

網路爬蟲中Jsoup請求

jsoup 是一款Java 的HTML解析器,可直接解析某個URL地址、HTML文字內容。它提供了一套非常省力的API,可通過DOM,CSS以及類似於jQuery的操作方法來取出和操作資料。下面是我寫的一個案例歡迎大家參考:

import java.io.IOException;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;
/*
 * author:合肥工業大學 管院學院 錢洋 
 *[email protected]
*部落格地址:http://blog.csdn.net/qy20115549/ */
public class JsoupTest { public static void main(String[] args) throws IOException { /* * 解析一個字串 */ String html = "First parse" + "Parsed HTML into a doc."; Document doc = Jsoup.parse(html); System.out.println(doc); /* * 解析url */
String url="http://www.tripadvisor.com/SearchForums?q=airbnb&x=18&y=10&pid=34633&s=+"; Document doc1=Jsoup.connect(url).userAgent("bbb").timeout(50000).get(); Elements ele=doc1.select("table[class=forumsearchresults]").select("tr[class~=firstpostrow?]"); for (Element elem:ele) { String _id=elem.attr("id"
); String _url="http://www.tripadvisor.com"+elem.select("td[onclick~=setPID?]").select("a"). attr("href"); String _content=elem.select("td[onclick~=setPID?]").select("a").text(); System.out.println(_id+"===="+_url+"===="+_content); } } }