Nutch搜索引擎系列

下面是Nutch搜索系列目录,希望对研究Nutch的同学有所帮助。

  目录安排:

  1)Nutch搜索引擎(第1期)_
Nutch简介及安装
[下载]

  2)Nutch搜索引擎(第2期)_
Solr简介及安装
[下载]

  3)Nutch搜索引擎(第3期)_
Nutch简单应用

  4)Nutch搜索引擎(第4期)_
Eclipse开发配置

1)Nutch1.2二次开发详细攻略

  (1)Windows平台下Cygwin环境的搭建

  地址:http://www.cnblogs.com/streamhope/archive/2011/07/27/2118397.html

  (2)Windows平台下Nutch1.2的搭建

  地址:http://www.cnblogs.com/streamhope/archive/2011/07/27/2118408.html

  (3)Nutch1.2二次开发(关于界面修改)

  地址:http://www.cnblogs.com/streamhope/archive/2011/07/27/2118564.html

  (4)Nutch1.2二次开发(关于中文分词)

  地址:http://www.cnblogs.com/streamhope/archive/2011/07/28/2119345.html

2) Nutch 1.3 学习笔记

  (1) Nutch 1.3 学习笔记(一)——简介及安装

  地址:http://blog.csdn.net/amuseme_lu/article/details/6710172

  (2)Nutch 1.3 学习笔记(二)——命令详解

  地址:http://blog.csdn.net/amuseme_lu/article/details/6710221

  (3)Nutch 1.3 学习笔记(三)——Inject

  地址:http://blog.csdn.net/amuseme_lu/article/details/6713386

  (4)Nutch 1.3 学习笔记(四)——CrawlDB Reader

  地址:http://blog.csdn.net/amuseme_lu/article/details/6716693

  (5)Nutch 1.3 学习笔记(五)——Generate

  地址:http://blog.csdn.net/amuseme_lu/article/details/6720079

  (6)Nutch 1.3 学习笔记(六)——SegmentReader

  地址:http://blog.csdn.net/amuseme_lu/article/details/6723788

  (7)Nutch 1.3 学习笔记(七)——Fetcher

  地址:http://blog.csdn.net/amuseme_lu/article/details/6724734

  (8)Nutch 1.3 学习笔记(八)——FetchThread

  地址:http://blog.csdn.net/amuseme_lu/article/details/6725561

  (9)Nutch 1.3 学习笔记(九)——ParseSegment

  地址:http://blog.csdn.net/amuseme_lu/article/details/6727516

  (10)Nutch 1.3 学习笔记(十)—— Updatedb

  地址:http://blog.csdn.net/amuseme_lu/article/details/6727703

  (11)Nutch 1.3 学习笔记(十一)——LinkDb

  地址:http://blog.csdn.net/amuseme_lu/article/details/6730756

  (12)Nutch 1.3 学习笔记(十二)——SolrIndexer

  地址:http://blog.csdn.net/amuseme_lu/article/details/6741321

  (13)Nutch 1.3 学习笔记(十三)——插件机制简单介绍

  地址:http://blog.csdn.net/amuseme_lu/article/details/6776555

  (14)Nutch 1.3 学习笔记(十四)——插件扩展

  地址:http://blog.csdn.net/amuseme_lu/article/details/6780244

  (15)Nutch 1.3 学习笔记(十五)——插件机制分析

  地址:http://blog.csdn.net/amuseme_lu/article/details/6786261

  (16)Nutch 1.3 学习笔记(十六)——页面评分机制 OPIC

  地址:http://blog.csdn.net/amuseme_lu/article/details/6793472

  (17)Nutch 1.3 学习笔记(十七)——页面评分机制 LinkRank 介绍

  地址:http://blog.csdn.net/amuseme_lu/article/details/6793481

  (18)Nutch 1.3 学习笔记(十八)——Nutch 2.0 的主要变化

  地址:http://blog.csdn.net/amuseme_lu/article/details/6793653

3)Nutch与起点R3集成之笔记

  (1)Nutch与起点R3集成之笔记(一)

  地址:http://my.oschina.net/sprint/blog/28549

  (2)Nutch与起点R3集成之笔记(二)

  地址:http://my.oschina.net/sprint/blog/28717

  (3)Nutch与起点R3集成之笔记(三)

  地址:http://my.oschina.net/sprint/blog/28746

  (4)Nutch与起点R3集成之笔记(四)

  地址:http://my.oschina.net/sprint/blog/29258

4)Nutch研究系列

  (1)Nutch安装

  地址:http://www.cnblogs.com/kwklover/articles/445916.html

  (2)剖析Nutch爬虫(一)

  地址:http://www.cnblogs.com/kwklover/articles/445917.html

  (3)剖析Nutch爬虫(二)

  地址:http://www.cnblogs.com/kwklover/articles/445924.html

  (4)剖析Nutch爬虫(三)

  地址:http://www.cnblogs.com/kwklover/articles/445925.html

  (5)Nutch爬虫工作流程及文件格式详细分析

  地址:http://www.cnblogs.com/kwklover/articles/445926.html

  (6)Nutch爬虫实验运行及抓取数据分析(一)

  地址:http://www.cnblogs.com/kwklover/articles/445927.html

  (7)Nutch爬虫实验运行及抓取数据分析(二)

  地址:http://www.cnblogs.com/kwklover/articles/445928.html

时间: 2024-10-05 23:51:58

Nutch搜索引擎系列的相关文章

Nutch搜索引擎(第4期)_ Eclipse开发配置

1.环境准备 1.1 本期引言 前三期分别介绍了Nutch与Solr在Linux上面的安装,并做了简单的应用,这一期从开发的角度进行,因为我们日常最熟悉的开发环境是Windows,所以本期详细介绍Windows平台的Nutch二次开发所需要进行的配置安装.当我们开发好之后,最后在部署到Linux环境中. 为了方便以后Nutch开发以及软件安装的管理,我们对开发环境配置进行如下安排: E:/(盘符) |----cygwin |----NutchWorkPlat |----ant |----solr

搜索引擎系列 ---lucene简介 创建索引和搜索初步

一.什么是Lucene? Lucene最初是由Doug Cutting开发的,2000年3月,发布第一个版本,是一个全文检索引擎的架构,提供了完整的查询引擎和索引引擎 :Lucene得名于Doug妻子的中名,同时这也她外祖母的姓;目前是Apache基金会的一个顶级项目,同时也是学习搜索引擎入门必知必会. Lucene 是一个 JAVA 搜索类库,它本身并不是一个完整的解决方案,需要额外的开发工作. 优点:成熟的解决方案,有很多的成功案例.apache 顶级项目,正在持续快速的进步.庞大而活跃的开

搜索引擎系列 -lucene简介 创建索引和搜索初步步骤

一.什么是Lucene? Lucene最初是由Doug Cutting开发的,2000年3月,发布第一个版本,是一个全文检索引擎的架构,提供了完整的查询引擎和索引引擎 :Lucene得名于Doug妻子的中名,同时这也她外祖母的姓;目前是Apache基金会的一个顶级项目,同时也是学习搜索引擎入门必知必会. Lucene 是一个 JAVA 搜索类库,它本身并不是一个完整的解决方案,需要额外的开发工作. 优点:成熟的解决方案,有很多的成功案例.apache 顶级项目,正在持续快速的进步.庞大而活跃的开

搜索引擎系列四:Lucene提供的分词器、IKAnalyze中文分词器集成

一.Lucene提供的分词器StandardAnalyzer和SmartChineseAnalyzer 1.新建一个测试Lucene提供的分词器的maven项目LuceneAnalyzer 2. 在pom.xml里面引入如下依赖 <!-- lucene 核心模块 --> <dependency> <groupId>org.apache.lucene</groupId> <artifactId>lucene-core</artifactId&

搜索引擎系列五:Lucene索引详解(IndexWriter详解、Document详解、索引更新)

一.IndexWriter详解 问题1:索引创建过程完成什么事? 分词.存储到反向索引中 1. 回顾Lucene架构图: 介绍我们编写的应用程序要完成数据的收集,再将数据以document的形式用lucene的索引API创建索引.存储. 这里重点要强调应用代码负责做什么,lucene负责做什么. 2. Lucene索引创建API 图示 通过该图介绍lucene创建索引的核心API:Document.IndexWriter Lucene中要索引的文档.数据记录以document表示,应用程序通过I

搜索引擎系列十:Solr(solrj 、索引API 、 结构化数据导入)

一.SolrJ介绍 1. SolrJ是什么? Solr提供的用于JAVA应用中访问solr服务API的客户端jar.在我们的应用中引入solrj: <dependency> <groupId>org.apache.solr</groupId> <artifactId>solr-solrj</artifactId> <version>7.3.0</version> </dependency> 2. SolrJ的核

Nutch+Lucene搜索引擎开发实践

网络拓扑 图 1 网络拓扑图 安装Java JDK 首先查看系统是否已经安装了其他版本的JDK,如果有,先要把其他版本的JDK卸载. 用root用户登录系统. # rpm-qa|grep gcj 显示内容其中包含下面两行信息 # java-1.6.0-openjdk-1.6.0.0-1.57.1.11.9.el6_4.i686 #java-1.7.0-openjdk-1.7.0.9-2.3.8.0.el6_4.i686 卸载 #yum -y remove java-1.6.0-openjdk #

这就是搜索引擎(三)——搜索引擎优化

这个系列的文章是一只试图通过产品角度出发去理解复杂庞大搜索引擎的汪写出来的,不足之处很多,欢迎广大技术.非技术同学阅读后指正错误,我们一起探讨共同进步 本章主要讲的是搜索引擎的优化,包括提高搜索效率(云存储.缓存机制).提高搜索质量(网页去重.用户搜索意图识别.网页反作弊)及搜索的发展方向.这三个方面是在网页抓取&搜索排序的基础上发展起来的. 一.提高搜索效率 1.1云存储 为什么要用云存储?引擎处理数据量巨大且为无结构或半结构的数据,云存储和云计算为解决存储和管理海量数据而生的. 这里只介绍一

Java精品高级课,架构课,java8新特性,P2P金融项目,程序设计,功能设计,数据库设计,第三方支付,web安全,视频教程

36套精品Java架构师,高并发,高性能,高可用,分布式,集群,电商,缓存,性能调优,设计模式,项目实战,P2P金融项目,大型分布式电商实战视频教程 视频课程包含: 高级Java架构师包含:Spring boot.Spring  cloud.Dubbo.Elasticsearch,Redis.ActiveMQ.Nginx.Mycat.Spring.MongoDB.ZeroMQ.Git.Nosql.Jvm.Mecached.Netty.Nio.Mina.java8新特性,P2P金融项目,程序设计,