《自己动手写搜索引擎》是猎兔企业搜索开发团队的软件产品研发和项目实践的经验汇总。《自己动手写搜索引擎》全方位展现出一个商用级别的Lucene搜索解决方案,主要包括爬虫、自然语言处理和搜索实现部分。爬虫部分介绍了网页遍历方法和从网页提取主要内容的方法。
自然语言处理部分包括了中文分词从理论到实现以及在搜索引擎中的实用等细节。
其他自然语言处理的经典问题与实现包括:文档排重、文本分类、自动聚类、语法解析树、拼写检查、拼音转换等理论与实现方法。
在实现搜索方面,《自己动手写搜索引擎》用简单的例子介绍了完整的搜索实现过程,覆盖了从索引库的设计和索引库与数据库的同步到搜索用户界面设计与实现。搜索用户界面包括实现布尔逻辑查询、按区间范围查询、搜索结果按日期排序等。《自己动手写搜索引擎》还进一步介绍了搜索排序的优化方法。
最后以基于Lucene的搜索服务器Solr为例,展示了Lucene的最新应用方法。
一起走吧户外活动网(http://www.1798hw.com/)是一家创业型的旅游搜索网站,上线于2010年8月份。 网站上线后已经积累了大量的会员。 目前因发展需要,寻求资金和技术合作,可以以资金或技术的方式入股。 如果您有兴趣,请致电010-81727660,或联系QQ:270954928 gtalk:luogan...
评分一起走吧户外活动网(http://www.1798hw.com/)是一家创业型的旅游搜索网站,上线于2010年8月份。 网站上线后已经积累了大量的会员。 目前因发展需要,寻求资金和技术合作,可以以资金或技术的方式入股。 如果您有兴趣,请致电010-81727660,或联系QQ:270954928 gtalk:luogan...
评分描述解释算法的语言太少了 整本书估计有一半以上是代码 没有信息检索方面的知识的话,书读起来会很吃力 期待第二版的改进
评分包括使用Java开发网络爬虫与Web数据挖掘等内容 http://www.lietu.com/images/WebCrawler.jpg
评分打开eclipse 然后把.project文件所在的路径作为Java项目导入即可。 例如光驱是e盘,则可以把 E:第2章Chapter3JavaPart 整个作为Java项目导入eclipse。 具体执行方式是点击右键选择"import"菜单,出来一个选择窗口,然后选择Existing Projects into Workspace。...
初学者不适用,没有条理
评分跟其他几本比较起来比较凌乱
评分没怎么仔细看,了解了一下大致内容,以后可能会搞这方面的项目。
评分最基本的抓取网页代码例子都跑步起来的,,,,还写毛线爬虫啊
评分代码贴太多了。
本站所有内容均为互联网搜索引擎提供的公开搜索信息,本站不存储任何数据与内容,任何内容与数据均与本站无关,如有需要请联系相关搜索引擎包括但不限于百度,google,bing,sogou 等
© 2025 book.quotespace.org All Rights Reserved. 小美书屋 版权所有