Go语言如何实现的web爬虫实例

田野里，高粱像喝醉了酒，频频点头；玉米正在变黄了的衣服里睡大觉；大豆也小坡了肚皮，蹦了出来；小白菜像列队的士兵整齐地排列在在菜地里。农民正忙忙碌碌地收获着一年的成果，田野里不时传出阵阵欢笑声。啊，秋天的景色真美啊！

本文实例讲述了Go语言实现的web爬虫方法。分享给大家供大家参考。具体分析如下：

这里使用 Go 的并发特性来并行执行 web 爬虫。
修改 Crawl 函数来并行的抓取 URLs，并且保证不重复。

package main

import (

 "fmt"

)

type Fetcher interface {

 // Fetch 返回 URL 的 body 内容，并且将在这个页面上找到的 URL 放到一个 slice 中。

 Fetch(url string) (body string, urls []string, err error)

}

// Crawl 使用 fetcher 从某个 URL 开始递归的爬取页面，直到达到最大深度。

func Crawl(url string, depth int, fetcher Fetcher) {

 // TODO: 并行的抓取 URL。

 // TODO: 不重复抓取页面。

 // 下面并没有实现上面两种情况：

 if depth <= 0 {

 return

 }

 body, urls, err := fetcher.Fetch(url)

 if err != nil {

 fmt.Println(err)

 return

 }

 fmt.Printf("found: %s %q\n", url, body)

 for _, u := range urls {

 Crawl(u, depth-1, fetcher)

 }

 return

}

func main() {

 Crawl("http://golang.org/", 4, fetcher)

}

// fakeFetcher 是返回若干结果的 Fetcher。

type fakeFetcher map[string]*fakeResult

type fakeResult struct {

 body string

 urls []string

}

func (f *fakeFetcher) Fetch(url string) (string, []string, error) {

 if res, ok := (*f)[url]; ok {

 return res.body, res.urls, nil

 }

 return "", nil, fmt.Errorf("not found: %s", url)

}

// fetcher 是填充后的 fakeFetcher。

var fetcher = &fakeFetcher{

 "http://golang.org/": &fakeResult{

 "The Go Programming Language",

 []string{

 "http://golang.org/pkg/",

 "http://golang.org/cmd/",

 },

 },

 "http://golang.org/pkg/": &fakeResult{

 "Packages",

 []string{

 "http://golang.org/",

 "http://golang.org/cmd/",

 "http://golang.org/pkg/fmt/",

 "http://golang.org/pkg/os/",

 },

 },

 "http://golang.org/pkg/fmt/": &fakeResult{

 "Package fmt",

 []string{

 "http://golang.org/",

 "http://golang.org/pkg/",

 },

 },

 "http://golang.org/pkg/os/": &fakeResult{

 "Package os",

 []string{

 "http://golang.org/",

 "http://golang.org/pkg/",

 },

 },

}

希望本文所述对大家的Go语言程序设计有所帮助。

本文Go语言如何实现的web爬虫实例到此结束。人生的路漫长而多彩，就像在天边的大海上航行，有时会风平浪静，行驶顺利;而有时却会是惊涛骇浪，行驶艰难。但只要我们心中的灯不熄灭，就能沿着自己的航线继续航行。谢谢大家支持！

全站频道

大家都在搜索：