发布于 2015-05-09 00:57:50 | 301 次阅读 | 评论: 0 | 来源: 网友投递

这里有新鲜出炉的精品教程,程序狗速度看过来!

Apache Nutch 基于Java的开源搜索引擎

Nutch 是一个开源Java 实现的搜索引擎。它提供了我们运行自己的搜索引擎所需的全部工具。包括全文搜索和Web爬虫。


Apache Nutch 1.10 发布,此版本现已提供下载:http://syncope.apache.org/downloads.html。 

更新内容:

Bug 修复

  • [SYNCOPE-654] - Some generic and uninformative error messages

  • [SYNCOPE-655] - Files under /etc/apache-syncope ignored

  • [SYNCOPE-656] - Debian configuration files overwrittern

  • [SYNCOPE-658] - Duplicate derived attribute after sync task when it is configured as accountid for the synched resource

  • [SYNCOPE-659] - Wrong fasterxml.jackson, common-lang3 version in the Import-Package in the syncope-common, syncope-client

  • [SYNCOPE-664] - Empty string values not allowed with Oracle DB

改进

  • [SYNCOPE-663] - Option to ignore users / roles during synchronization or push

完整改进请看:http://s.apache.org/S4Z

Nutch 是一个开源Java 实现的搜索引擎。它提供了我们运行自己的搜索引擎所需的全部工具。包括全文搜索和Web爬虫。

Nutch的创始人是Doug Cutting,他同时也是Lucene、Hadoop和Avro开源项目的创始人。

Nutch 诞生于2002年8月,是Apache旗下的一个用Java实现的开源搜索引擎项目,自Nutch1.2版本之后,Nutch已经从搜索引擎演化为网络爬 虫,接着Nutch进一步演化为两大分支版本:1.X和2.X,这两大分支最大的区别在于2.X对底层的数据存储进行了抽象以支持各种底层存储技术。

在 Nutch的进化过程中,产生了Hadoop、Tika、Gora和Crawler Commons四个Java开源项目。如今这四个项目都发展迅速,极其火爆,尤其是Hadoop,其已成为大规模数据处理的事实上的标准。Tika使用多 种现有的开源内容解析项目来实现从多种格式的文件中提取元数据和结构化文本,Gora支持把大数据持久化到多种存储实现,Crawler Commons是一个通用的网络爬虫组件。

Nutch 致力于让每个人能很容易, 同时花费很少就可以配置世界一流的Web搜索引擎. 为了完成这一宏伟的目标, Nutch必须能够做到:

  • 每个月取几十亿网页

  • 为这些网页维护一个索引

  • 对索引文件进行每秒上千次的搜索

  • 提供高质量的搜索结果

  • 以最小的成本运作



历史版本 :
Apache Nutch 1.14 发布,Web 爬虫
Apache Nutch 1.1.3 发布,Web 爬虫
Apache Nutch 2.3.1 发布,搜索引擎
Apache Nutch 1.11/ 2.3 发布,搜索引擎
Apache Nutch 1.10 发布,搜索引擎
Apache Nutch v2.3 发布,Java实现的网络爬虫
Apache Nutch 1.9 发布,开源的搜索引擎
最新网友评论  共有(0)条评论 发布评论 返回顶部

Copyright © 2007-2017 PHPERZ.COM All Rights Reserved   冀ICP备14009818号  版权声明  广告服务