首页 > 资讯 > 后端开发 > GO >Golang网络爬虫框架gocolly/colly怎么用

403

分享到

Golang网络爬虫框架gocolly/colly怎么用

2023-06-05 05:06:30 403人浏览薄情痞子

摘要

小编给大家分享一下golang网络爬虫框架Gocolly/colly怎么用，相信大部分人都还不怎么了解，因此分享这篇文章给大家参考一下，希望大家阅读完这篇文章后大有收获，下面让我们一起去了解一下吧！安装go get -u GitHub.co

小编给大家分享一下golang网络爬虫框架 Gocolly/colly怎么用，相信大部分人都还不怎么了解，因此分享这篇文章给大家参考一下，希望大家阅读完这篇文章后大有收获，下面让我们一起去了解一下吧！

安装

go get -u GitHub.com/gocolly/colly/...

例子

import ( "fmt" "github.com/gocolly/colly")func main() { c := colly.NewCollector() c.OnResponse(func(r *colly.Response) { fmt.Println("IP:", string(r.Body)) }) //c.SetProxy("Http://127.0.0.1:1080") c.Visit("http://ip.cip.cc/")}

SetProxy函数可以用来配置HTTP代理。

colly的主体是Collector对象，管理网络通信和负责在作业运行时执行附加的回掉函数。使用colly需要先初始化Collector：

c := colly.NewCollector()

vgo

vgo是Go语言推出的第三方库管理工具，在Go语言新版本中使用。

常用的命令行：

· go help mod 查看帮助。

· go mod init <项目模块名称>初始化模块，会在项目根目录下生成 go.mod 文件，是可以自己手动编辑的。

依赖包大多在Github上，安装依赖可能会出现连接超时等问题，可以配置全局git代理：

git config --global http.proxy http://127.0.0.1:1080git config --global https.proxy https://127.0.0.1:1080#取消代理：git config --global --unset http.proxygit config --global --unset https.proxy

cmd走shadowsocks代理：

set http_proxy=127.0.0.1:1080set https_proxy=127.0.0.1:1080curl cip.ccIP : 140.206.97.42地址 : 中国上海数据二 : 上海市 | 联通URL : http://www.cip.cc/140.206.97.42

linux使用export设置环境变量，代码同上。

回掉函数的调用顺序

OnRequest 在发起请求前被调用。

OnError 请求过程中如果发生错误被调用。

OnResponse 收到回复后被调用。

Onhtml 在OnResponse之后被调用，如果收到的内容是HTML 。

OnScraped 在OnHTML之后被调用。

官方提供的Basic示例代码：

package mainimport ( "fmt" "github.com/gocolly/colly")func main() { // Instantiate default collector c := colly.NewCollector( // Visit only domains: hackerspaces.org, wiki.hackerspaces.org colly.AllowedDomains("hackerspaces.org", "wiki.hackerspaces.org"), ) // On every a element which has href attribute call callback c.OnHTML("a[href]", func(e *colly.HTMLElement) { link := e.Attr("href") // Print link fmt.Printf("Link found: %q -> %s\n", e.Text, link) // Visit link found on page // Only those links are visited which are in AllowedDomains c.Visit(e.Request.AbsoluteURL(link)) }) // Before making a request print "Visiting ..." c.OnRequest(func(r *colly.Request) { fmt.Println("Visiting", r.URL.String()) }) // Start scraping on https://hackerspaces.org c.Visit("https://hackerspaces.org/")}

该实例程序仅访问hackerspaces.org域内的链接，OnHTML回掉函数的选择器为a[href]，选择页面内具有href属性的a类型元素，找到链接后继续抓取。运行的部分结果如下：

Visiting https://hackerspaces.org/Link found: "navigation" -> #column-oneLink found: "search" -> #searchInputLink found: "" -> /File:Cbase07.jpgVisiting https://hackerspaces.org/File:Cbase07.jpgLink found: "navigation" -> #column-oneLink found: "search" -> #searchInputLink found: "File" -> #fileLink found: "File history" -> #filehistoryLink found: "File usage" -> #filelinksLink found: "" -> /images/e/ec/Cbase07.jpgVisiting https://hackerspaces.org/images/e/ec/Cbase07.jpgLink found: "800 × 600 pixels" -> /images/thumb/e/ec/Cbase07.jpg/800px-Cbase07.jpgVisiting https://hackerspaces.org/images/thumb/e/ec/Cbase07.jpg/800px-Cbase07.jpg

以上是“Golang网络爬虫框架gocolly/colly怎么用”这篇文章的所有内容，感谢各位的阅读！相信大家都有了一定的了解，希望分享的内容对大家有所帮助，如果还想学习更多知识，欢迎关注编程网GO频道！

您可能感兴趣的文档:

Go语言（Golang）教程

--结束END--

本文标题: Golang网络爬虫框架gocolly/colly怎么用

本文链接: https://www.lsjlt.com/news/241339.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

Golang网络爬虫框架gocolly/colly怎么用

安装

例子

vgo

常用的命令行：

回掉函数的调用顺序

Golang网络爬虫框架gocolly/colly怎么用

Golang爬虫框架colly的使用

Golang爬虫框架colly使用浅析

网络爬虫框架Scrapy怎么用

如何使用Scrapy网络爬虫框架

关于Python网络爬虫框架scrapy

开源python网络爬虫框架Scrapy

golang爬虫colly发送post请求怎么实现

【100天精通python】Day45：python网络爬虫开发_ Scrapy 爬虫框架

scrapy爬虫框架怎么使用

Java 实现网络爬虫框架详细代码

如何实现Java手撸网络爬虫框架

springboot+WebMagic+MyBatis爬虫框架怎么用

爬虫技术框架Heritrix怎么使用

怎么使用Python的Scrapy爬虫框架

网站怎么阻止网络爬虫

python爬虫框架Scrapy怎么安装使用

python爬虫入门之Scrapy框架怎么用

怎么在python中使用feapde爬虫框架

怎么用Scrapy+Gerapy部署网络爬虫

Sqlx 连接具有相同字段的表

如何从 go 中的另一个包访问结构变量？

使用 kafka-go 在 Kafka 中计划创建消费者

无法从 Golang 中的 Google userinfo API 响应访问电话号码（使用 golang.org/x/oauth2 和 Google People API）

如何在Golang中为Azure SDK指定x509证书

etcd 事务中的原子计数器增量

将字段添加到 MongoDB 内部对象

如何处理关闭同一通道的多个 go 例程？

Cron Job 不会用 TimeZone 触发

API 网关 -> Go Lambda 参数