社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Git

GitHub 5.2k Star,一个专门给 Agent 做搜索的Skill,实测很强!

极客之家 • 4 天前 • 48 次点击  

 

我用 Codex 干活有段时间了,写代码、改 bug 这些都挺顺的,就搜索这块一直让我别扭。不是偶尔别扭,是它一联网我就得盯着:

1、拿回来的基本是一堆链接。 想看正文,它还得再去抓页面,抓回来的东西里混着导航栏、广告,还有一堆没清干净的 HTML 标签。一个页面几千字,真正有用的可能就几行,剩下的全靠 Agent 自己过滤。

2、复杂点的问题,它要拆成好几个查询一步一步查。 我盯着跑过一次,一个需求前后调了七八轮搜索,每轮都要把结果读一遍再决定下一步,这个Token烧的有点让人心疼。

3、搜索结果经常被同一个网站占满,SEO 味道重的内容排在前面。 人搜东西扫一眼能跳过去,Agent 没这个判断力,你喂给它什么它就信什么。

4、专业方向基本指望不上。 让它找代码参考,翻出来的多是教程水文;查论文、查金融数据这种,通用搜索根本覆盖不到。

前阵子刷到 AnySearch 这个项目,登顶过 Product Hunt 的周榜,看介绍说是专门给 Agent 做的搜索,不是给人用的那种。我有点好奇这玩意跟自带搜索能差多少,就接进 Codex 用了几天。直接说结论,上面这四个问题,基全被它解决了。

AnySearch 是什么

先把定位说清楚,AnySearch 不是你在浏览器里搜东西用的那种搜索引擎,它的服务对象是 AI。Agent 接到任务需要查资料的时候,通过它去拿结果,拿回来的内容可以直接进推理流程,不用人再插手处理。官方的说法是面向 Agent 和 AI 工作流的搜索基础设施,我觉得这个说法挺准的。

这个项目今年 5 月 11 号上线,第一个月就有超过 10 万开发者接进来,现在用户 20 多万,累计搜索调用超过 2,000 万次。它在 GitHub 上的 Skill 仓库也有 5.2k Star,上线一周就上了 Skills.sh 的热榜。能在这个时间里涨到这个量,一方面说明被搜索问题折磨的不止我一个,另一方面说明这个项目确实牛。

我们来看看效果

实测一:正文直接能用,不用二次爬取

先跑了个常规的联网查询,把完整链路看一遍。我在 Codex 里提了一个需要查最新信息的问题:

帮我查一下 AnySearch 这个产品最近的动态,包括它什么时候上线的、现在有多少用户、拿过什么成绩,信息要是最新的,每条都标来源。

它判断要联网,自己调了 AnySearch,搜索回来之后基于拿到的正文给出了答案,答案里带着来源。

有个细节可以留意下,搜索那一步拿回来的就是能直接用的内容,是提前清洗过的 Markdown,乱码、HTML 标签、页面上那些杂七杂八的东西都去掉了,每条结果还带着来源标注。以前这部分解析和清洗的代码得我自己维护,现在全省了。

痛点 3 那个刷屏的问题这次也没出现。返回的结果来源比较分散,没有被同一个网站占满的情况。它在排序上压低了单一来源的权重,同等相关性下让信息更丰富的结果排在前面。反正喂给 Agent 的料干净了,它最后给出来的东西才靠得住。

实测二:代码查询自动走代码源

这个场景是我自己平时用得最多的,也最看重。让 AI 帮忙找参考实现,最怕它给我翻出来一堆教程水文,这里抄一段那里抄一段,想直接用都没地方下手。

这次我给的需求说得比较死:找一个生产级的实现,参考来源必须是 GitHub 真实仓库里的代码,不要博客里的示例片段。

我想在 Java 项目里实现一个带重试和限流的 HTTP 客户端,要求是生产环境能用的级别。帮我找 GitHub 上真实开源仓库里的实现作为参考,不要博客和教程里的示例代码,找到后整理出实现思路,并把仓库出处给我。

Codex 识别出这是代码类的查询,AnySearch 那边把请求路由到了代码源上,返回的结果来自真实仓库,正文直接就能用。Codex 拿着这些内容整理出了实现方案,出处也一并给了。

这里多说一句,AnySearch 背后接的不只是公开网页,还有金融、法律、学术、安全、代码这些垂直领域的专业数据源,一共 20 多个领域。查询进来之后它先判断意图,再把请求分到合适的数据源上,比如查代码它就走代码源,查论文就走学术源,不用我管。痛点 4 说的那些通用搜索覆盖不到的专业方向,靠的就是这层。

中间我只提了一次需求,剩下的都是它自己跑完的,来源是真实仓库,不是转过好几手的教程,这一点跟我以前用自带搜索的体验差别挺大。

实测三:一次查询拿回几个方向的信息

代码场景之外,我还试了一个金融方向的查询。我让 Codex 帮我查一家公司的最新融资情况和产品定价,这类信息平时自己查也挺烦的,融资新闻散在各个媒体报道里,定价要去官网翻,凑齐一份得开好多个页面。

帮我查一下杭州深度求索人工智能基础技术研究有限公司这家公司最近一轮融资的情况,包括融资金额、估值和投资方,另外查一下 DeepSeek 目前各档订阅的定价,信息都要标来源。

AnySearch 判断这是金融类的查询,路由到了金融数据源上。返回的结果把融资信息、定价这几块都覆盖到了,每条都带来源。Codex 拿着这些内容汇总成了一份完整的情况说明,哪条信息来自哪里标得很清楚。

这个场景让我有点意外的是,一次查询就把几个方向的信息都拿回来了,不用我拆成好几个问题分开问。这就解决痛点 2 多轮查询的问题了,调用次数降下来之后,Token 消耗这块就可控多了,对正经拿 Agent 跑工作流的人来说挺关键的。做竞品调研或者行业研究的时候,这个能省不少事。

和海外同类工具比了一下

给 Agent 做搜索这个方向,海外也有几个产品,Brave、Tavily、Exa 我用过或者查过资料,拉个表放在一起看:

表里挑几个点说一下,Brave 只给标题和摘要,Agent 想读全文还得自己再配一层抓取,痛点 1中提到的只返回链接或者散乱内容的问题等于没解决。Tavily 和 Exa 对 LLM 都比较友好,但免费额度是按月算的,量给得不大,AnySearch 是按天算,每天 1,000 次,个人用基本碰不到上限。再加上正文洗好直接给、垂直源自动路由这两点,日常用起来省心不少。

另外那几家都是海外服务,注册和支付都得折腾一圈,AnySearch 官网直接注册就能用。

怎么使用

想自己试试的话,流程就三步:

  1. 1. 打开 anysearch.com,注册账号
  2. 2. 进控制台拿 API Key
  3. 3. 看你用什么工具,Codex 装 Skill,Cursor、Claude Code 配 MCP,自己写的 Agent 调 API

额度这块说一下,普通注册账号每天有 1,000 次免费请求,这个免费版是长期有效的,不是那种到期就停的试用。

学生认证或者开发者认证之后,每天 2,000 次,认证入口在 anysearch.com/pricing。个人平时用,1,000 次已经很宽裕了,拿它跑工作流的建议直接去认证。

以 Codex 安装 AnySearch Skill 为例

先去官网注册个账号,进控制台拿 API Key

装 Skill 的过程没什么坑,官方仓库是 anysearch-skill,照着文档把 Skill 装上、Key 配进去就行,前后几分钟的事。我习惯让 Codex 自己操作:

装完我先验证了一下,随便问了个需要联网才能答的问题,看 Codex 是不是走了 AnySearch 就OK了。

最后说两句

给人用的搜索和给 Agent 用的搜索,我现在觉得真是两种东西。人能一眼扫过去把广告和无关内容跳掉,Agent 做不到,它只能你给它什么它就处理什么。所以搜索这层要是专门替 Agent 想过,后面整条链路都会跟着顺。

隐私这块也提一句,AnySearch 说的是无追踪、零遥测,查询内容不用担心被留下来做什么,接进自己的工作流或者公司项目里,这方面没什么顾虑。

我自己这几天用下来,Codex 查资料这块明显省心了,返回的东西干净,来源标得清楚,垂直方向也比自带搜索覆盖得广。反正免费额度每天都有,接一次也就几分钟,日常在使用Agent的或有AI工作流的,建议去 anysearch.com 注册一个账号跑两个 query 试试,自己跑一遍就懂我说的这个工具的含金量了。

 

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199583