使用 Elasticsearch 在 Go 中构建 Web 搜索引擎

网络搜索引擎对于索引大量在线信息至关重要，可以在几毫秒内访问这些信息。在这个项目中，我用 go (golang) 构建了一个名为 relaxsearch 的搜索引擎。它通过与强大的搜索和分析引擎 elasticsearch 集成，将网络抓取、定期数据索引和搜索功能结合在一起。在这篇博客中，我将带您了解 relaxsearch 的主要组件、架构，以及它如何有效地抓取和索引数据，以实现基于关键字的快速搜索。

relaxsearch 概述

relaxsearch 围绕两个主要模块构建：

relaxengine：由 cron 作业提供支持的网络抓取工具，它定期抓取指定的网站、提取内容并在 elasticsearch 中为其建立索引。
relaxweb：一个 restful api 服务器，允许用户搜索索引数据，提供分页、过滤和内容突出显示以实现用户友好的响应。

项目动机

从头开始创建搜索引擎项目是了解网络抓取、数据索引和高效搜索技术的好方法。我想利用 go 的效率和 elasticsearch 强大的索引创建一个简单但实用的搜索引擎，具有快速数据检索和易于扩展的特点。

主要特点

自动抓取：使用 cron 作业，relaxengine 可以定期运行，抓取数据并将其存储在 elasticsearch 中。
全文搜索：relaxweb提供全文搜索功能，按关键字索引内容，检索速度快。
rest api：可通过带有分页、日期过滤和内容突出显示参数的 restful api 进行访问。
数据存储：索引内容存储在elasticsearch中，允许可扩展且高度响应的查询。

relaxsearch的架构

1.relaxengine（网页抓取器和索引器）

relaxengine 是一个用 go 编写的网络抓取工具，用于导航网页、提取和存储内容。它作为 cron 作业运行，因此可以定期（例如每 30 分钟）运行一次，以保持索引更新为最新的 web 数据。其工作原理如下：

种子 url：relaxengine 开始从指定的种子 url 进行抓取，然后跟踪站点内的链接直至可配置的深度。
内容解析：对于每个页面，它提取标题、描述和关键字，构建信息数据集。
elasticsearch 中的索引：抓取的内容在 elasticsearch 中建立索引，准备进行全文搜索。每个页面的数据都存储有唯一的标识符、标题、描述和其他元数据。

2.relaxweb（搜索api）

relaxweb 提供 restful api 端点，可以轻松查询和检索 elasticsearch 中存储的数据。 api 接受关键字、分页、日期过滤等多个参数，以 json 格式返回相关内容。

api 端点：/search
查询参数：
- 关键字：主要搜索词。
- from 和 size：分页控制。
- daterangestart 和 daterangeend：根据数据时间戳过滤结果。

使用 Elasticsearch 在 Go 中构建 Web 搜索引擎

关键组件和代码片段

下面是一些来自 relaxsearch 的重要组件和代码摘录，以说明其工作原理。

relaxengine 的主要 go 代码

核心功能位于 main.go 文件中，其中 relaxengine 使用 gocron 初始化调度程序来管理 cron 作业，设置 elasticsearch 客户端，并开始从种子 url 进行爬取。

func main() {
    cfg := config.loadconfig()
    esclient := crawler.newelasticsearchclient(cfg.elasticsearchurl)
    c := crawler.newcrawler(cfg.depthlimit, 5)
    seedurl := "https://example.com/" // replace with starting url

    s := gocron.newscheduler(time.utc)
    s.every(30).minutes().do(func() {
        go c.startcrawling(seedurl, 0, esclient)
    })
    s.startblocking()
}

爬虫和索引逻辑

crawler.go 文件处理网页请求、提取内容并为其建立索引。使用elastic包，每个抓取的页面都存储在elasticsearch中。

func (c *crawler) startcrawling(pageurl string, depth int, esclient *elastic.client) {
    if depth > c.depthlimit || c.isvisited(pageurl) {
        return
    }
    c.markvisited(pageurl)
    links, title, content, description, err := c.fetchandparsepage(pageurl)
    if err == nil {
        pagedata := pagedata{url: pageurl, title: title, content: content, description: description}
        indexpagedata(esclient, pagedata)
    }
    for _, link := range links {
        c.startcrawling(link, depth+1, esclient)
    }
}

在relaxweb中搜索api代码

在relaxweb服务中，api端点提供全文搜索功能。端点 /search 接收请求并查询 elasticsearch，根据关键字返回相关内容。

func searchhandler(w http.responsewriter, r *http.request) {
    keyword := r.url.query().get("keyword")
    results := queryelasticsearch(keyword)
    json.newencoder(w).encode(results)
}

设置 relaxsearch

克隆存储库

   git clone https://github.com/ravikisha/relaxsearch.git
   cd relaxsearch

配置

使用 elasticsearch 凭证更新 relaxengine 和 relaxweb 的 .env 文件。
使用 docker 运行

relaxsearch 使用 docker 来轻松设置。只需运行：

   docker-compose up --build

docker setup

使用 Elasticsearch 在 Go 中构建 Web 搜索引擎

挑战与改进

可扩展性：elasticsearch 可以很好地扩展，但处理大量链接的大量抓取需要针对更大规模的部署进行优化。
强大的错误处理：增强错误处理和重试机制将提高弹性。

结论

relaxsearch 是基本搜索引擎的教育和实践演示。虽然它仍然是一个原型，但该项目对于理解 web 抓取、全文搜索以及使用 go 和 elasticsearch 进行高效数据索引的基础知识很有帮助。它为可扩展环境中的改进和实际应用开辟了途径。

探索 github 存储库，亲自尝试 relaxsearch！

以上就是使用 Elasticsearch 在 Go 中构建 Web 搜索引擎的详细内容，更多请关注其它相关文章！