腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
工具
TVP
最新优惠活动
文章/答案/技术大牛
搜索
搜索
关闭
发布
精选内容/技术社群/优惠产品,
尽在小程序
立即前往
文章
问答
(9999+)
视频
沙龙
2
回答
浏览器限制会影响网页
爬虫
吗?
、
、
return Redirect("/h"); return View(); 问题:如果我限制一些浏览器访问我的主视图,它也会限制对
网络
爬虫
的访问吗
浏览 0
提问于2013-02-21
得票数 0
回答已采纳
1
回答
搜索引擎,它根据非结构化数据创建有关主题的信息表。
、
、
、
我正在寻找一个web应用程序,它可以以与搜索引擎非常相似的方式从
网络
上收集数据,但它不会将结果作为标题和摘要的列表,而是将结果转储到一个表中,试图从其内部索引中的页面中提取元数据。(很久以前,谷歌有一个叫做Google Squared的
网络
应用程序。今天还有其他类似的工具吗?这是维基百科页面中的相关描述: Google从整个
网络
中提取结构化数据,并以类似电子表格的格式显示其结果。每个搜索查询返回一个搜索结果表,其中有自己的一组列--与搜索主题相关联的公共属性。
浏览 0
提问于2023-02-07
得票数 2
5
回答
如何将动态站点转换为可从CD演示的静态站点?
、
、
有没有人对
爬虫
有什么好的建议,可以处理像链接清理,flash,一些ajax,css等等?我知道机会很小,但我认为在我开始编写自己的工具之前,我应该在这里抛出这个问题。
浏览 3
提问于2008-09-22
得票数 9
回答已采纳
2
回答
在网站和独立应用程序中使用Django框架
、
我计划为它写一个
网络
爬虫
和一个基于
网络
的前端(或者至少是它找到的信息)。我想知道是否可以使用Django框架让
网络
爬虫
使用与网站相同的MySQL后端(而不是让
网络
爬虫
本身成为“网站”)。
浏览 1
提问于2009-06-04
得票数 1
回答已采纳
1
回答
爬取白页的可能解决方案
、
我正处于一个我必须编写的程序的开始阶段,该程序将从我拥有的大型数据库中提取用户,并将其与任何类似于Whitepages电话簿的内容进行比较。这样做的原因是为了用更新的相关联系信息更新存储在我的数据库中的任何旧联系信息。到目前为止,我只接触过Whitepages Pro,它提供了一个API,允许我对他们的数据库运行一些查询,并返回我认为是最新的信息。我可以访问用户的电话号码、姓名和地址,因此最初的想法是将旧的电话号码+姓名与更新的数据库进行比较,以更正旧的数据。我的问题是,对于我的问题,这看起来是一个好的解决方案吗?Whitepages似乎是我唯一可以使用的工具(它确实花费了300美元,但如果它
浏览 1
提问于2015-05-01
得票数 0
5
回答
有哪些好的基于Ruby的
网络
爬虫
?
、
我正在考虑写我自己的,但我想知道是否有好的
网络
爬虫
在那里是用Ruby编写的。 除了一个成熟的
网络
爬虫
,任何可能有助于构建
网络
爬虫
的gem都将是有用的。我知道这个问题的这一部分在几个地方被涉及到了,但是一个适用于构建
网络
爬虫
的宝石列表也是一个很好的资源。
浏览 2
提问于2011-02-13
得票数 21
回答已采纳
1
回答
Facebook Linter / Open Graph截取URL路径
、
、
、
、
我一直在网上和StackOverflow上寻找答案,但我没有找到完全适用于我的情况的案例。我使用Facebook Linter来调试FB抓取我的meta标签的方式。如果我在一个简单的About页面上使用它,它可以提取所有内容,特别是og:url元标记。当我抓取正常的内容页面时,问题就开始了。尽管我已经三次检查了我的标记格式是否正确,但FB Linter将URI从URL中删除,因此它报告og:url标记只有域名electionstats.com/!页面上实际存在的og:url标记如下所示: 我怀疑这是FB缓存页面的问题,因为在我的About页面上,我进行了快速代码更改,更
浏览 3
提问于2011-10-10
得票数 0
回答已采纳
1
回答
文件-启用模块elasticsearch后的问题
错误实例/beat.go:1015退出:未能启动
爬虫
:创
建模
块重新加载程序失败:无法为文件集创
建模
块注册表:为文件集elasticsearch/审核获取配置错误:错误解释输入的模板:模板:文本:在<.paths>:range不能迭代/opt/aaa-<.paths>_audit.json退出:失败启动
爬虫
:创
建模
块重新加载程序失败:无法为文件集创
建模
块注册表:为文件集获取配置:获取文件集elasticsearch
浏览 3
提问于2022-02-17
得票数 0
1
回答
胶
爬虫
无法使用snappy压缩json文件分类和创建表。
、
、
、
、
我还有一个Glue Crawler,它使用那个桶创
建模
式。但是,
爬虫
将表分类为未知表。它无法检测到文件确实是json。根据下面的文档,Glue
爬虫
提供了带有JSON文件的快速压缩,但我无法实现。
浏览 7
提问于2022-09-29
得票数 0
1
回答
Web Crawler的功能
、
、
网络
爬虫
是否只从网页中返回提取的文本?例如,如果web服务器中也存储了一些pdf/doc文件。
网络
爬虫
可以爬行它们并返回它们的内容吗?不管怎样,对于一个好的开源Java
网络
爬虫
有什么建议呢? 谢谢!
浏览 2
提问于2011-06-26
得票数 0
回答已采纳
1
回答
React / JSX生成的HTML元素对Google Web
爬虫
是不可见的吗?
、
、
、
、
我最近读了一篇文章,关于用JavaScript创建的HTML元素是如何不被Googlebot / Google
爬虫
拾取的。我即将开始学习React,其中一个原因是你可以创
建模
板文件和组件,这样就可以很容易地复制页眉和页脚等常见功能,以保持代码干燥。但我担心的是,如果我这样做,React / JSX生成的HTML实际上不会被
网络
爬虫
跟踪,因此它基本上是不可见的,这将产生大量潜在的负面影响,尤其是劣质的SEO。
浏览 10
提问于2017-12-19
得票数 0
5
回答
Googlebot是用哪种编程语言编写的(或任何其他高效的
网络
爬虫
)?
、
或者,更普遍的是,高效的
网络
爬虫
是用哪种语言编写的? 我见过很多Java语言,但在我看来,它不是最适合开发
网络
爬虫
的语言,因为它产生了太多的开销(尝试使用Heritrix
网络
爬虫
,它非常重)。
浏览 0
提问于2009-10-29
得票数 1
回答已采纳
2
回答
建立一个自定义的网页
爬虫
的最佳方法,以便在URL中找到带有任意文本的站点?
、
但是,没有使用任何搜索引擎,这意味着,编写一个纯
网络
爬虫
。--很明显,它永远不会停下来运行.它甚至在碰到我想要的东西之前会遇到很多“垃圾”站点。
浏览 8
提问于2010-09-26
得票数 0
回答已采纳
2
回答
在MYSQL中删除非常非常相似的行
、
在PHPMYAdmin中,我正在运行一个
网络
爬虫
。
网络
爬虫
偶尔会拾取相同的urls。在
网络
爬虫
中,它已经索引了数千个链接,我不想要重复的链接。有没有办法在SQL中删除相似的行(唯一的区别是id字段)
浏览 1
提问于2012-08-17
得票数 0
2
回答
基于PHP的Web
爬虫
或基于JAVA的Web
爬虫
、
、
我对基于PHP的
网络
爬虫
有些怀疑,它能像基于java线程的
爬虫
一样运行吗?我之所以问这个问题,是因为在java中,线程可以一次又一次地执行,我不认为PHP有类似线程的功能,你们能说一下,哪个
网络
爬虫
更能充分利用吗?基于PHP的
爬虫
还是基于Java的
爬虫
浏览 1
提问于2010-07-27
得票数 0
回答已采纳
1
回答
失败爬行器的scrappy状态页面
、
我做了一个蜘蛛来抓取新闻,下面是代码handle_httpstatus_list = [404, 500]allowed_domains = ['abctvnepal.com.np'] 'http://www.abctvnepal.com.np', if response.status in self.handle_httpstatus_lis
浏览 1
提问于2014-06-26
得票数 0
3
回答
非常简单的C++
网络
爬虫
/蜘蛛?
、
我试图在C++中做一个非常简单的网页
爬虫
/蜘蛛应用程序。我一直在使用谷歌搜索一个简单的,以了解这个概念。我发现了这个: 然而,这是复杂的理解对我来说,因为我开始学习C++大约一个月前。
浏览 15
提问于2010-11-25
得票数 22
回答已采纳
2
回答
网络
爬虫
的最佳数据库设计
、
、
、
许多数据库系统适合与
网络
爬虫
一起工作,但是有没有专门为
网络
爬虫
开发的数据库系统(在.net中)。1)与
网络
爬虫
一起工作的最好的数据库系统是什么? 2)是否有涵盖所有功能的数据库系统!
浏览 2
提问于2011-07-05
得票数 1
1
回答
在angular universal中检测网站页面中的
网络
爬虫
、
、
、
我想要检测服务器端呈现的对我的页面的当前请求- ssr来自
网络
爬虫
或普通用户。而不是在用户使用我的页面时运行。 如何检测这个东西?
浏览 4
提问于2019-10-22
得票数 1
3
回答
如何在ABOT C#
网络
爬虫
中获取html输出页面?
、
我正在尝试用ABOT在c#.i中制作
网络
爬虫
,我搜索了很多例子,并添加了ABOT
网络
爬虫
。从那我只能得到日志输出而不是超文本标记语言页面输出。帮助我从ABOT
网络
爬虫
在C#中获得超文本标记语言输出。谢谢。
浏览 4
提问于2013-09-12
得票数 5
点击加载更多
扫码
添加站长 进交流群
领取专属
10元无门槛券
手把手带您无忧上云
相关
资讯
网络爬虫
网络爬虫简介
网络爬虫常用的几种技巧,三探爬虫,理解爬虫
什么是网络爬虫?
Golang 原生实现简单爬虫:了解网络爬虫原理
热门
标签
更多标签
云服务器
ICP备案
对象存储
腾讯会议
实时音视频
活动推荐
运营活动
广告
关闭
领券