上周在 GitHub Trending 上看到一个项目叫 Agent-Reach,日增 1045 星,简介只有一句话——"Give your AI Agent the ability to search the entire internet"。
给 AI Agent 装上全网搜索能力?这不就是我一直在找的东西吗?
我们团队在做一个行业研究 Agent,需要实时抓取多个平台的讨论数据。之前自己写爬虫,被反爬搞到怀疑人生——Reddit 要 OAuth,Twitter/X 要 API Key(还收费),B 站和知乎各种验证码。维护成本比开发成本还高。
Agent-Reach 号称"无需任何 API Key,一条命令部署,零额外费用"。
我抱着试试看的心态装了。
选型理由:为什么选 Agent-Reach 而不是自建爬虫?

坑 1:小红书搜索不稳定,成功率只有 60%
文档说支持小红书,但实测发现小红书的搜索经常超时。原因是小红书的反爬机制很激进,Agent-Reach 用的是模拟浏览器请求,但没做指纹伪装。
解决方案:我在 Agent-Reach 外面包了一层重试逻辑,3 次超时后换 IP(用代理池),成功率提升到 85%。但这也意味着不能完全"零成本"了,代理池还是要花钱的。
坑 2:返回数据格式不统一,不同平台的字段名不一样
Reddit 返回的数据结构是{title, body, upvotes, comments},Twitter 是{text, likes, retweets},B 站是{title, description, play, danmaku}。每个平台的字段名和结构都不一样,直接灌进 Agent 会导致理解混乱。
解决方案:我写了一个统一适配层,把所有平台的返回数据标准化为{platform, title, content, engagement_score, url, timestamp}格式。engagement_score 是根据各平台的互动指标换算的统一热度值。
对了。顺嘴提一句,技术大厂,前后端 - 测试机会,全国一线及双线城市均有坑位(https://jsj.top/f/o38ijj)待遇和稳定性还不错,感兴趣看看。
坑 3:并发请求太多会被平台封 IP
我在做竞品调研时,一次性搜索了 6 个平台 5 个关键词,总共 30 个并发请求。结果 GitHub 和 Reddit 直接返回 429,Twitter 临时封了我的 IP 2 小时。
解决方案:加了个简单的限流器,每秒最多 3 个请求,每个平台间隔 2 秒。搜索时间从 30 秒变成 3 分钟,但稳定性从 70% 提升到 98%。
最终数据对比:
结论:Agent-Reach 适合"快速验证 + 中等精度"的搜索场景,不适合做高精度的数据采集。如果你的 Agent 需要实时、精确、全量的数据,还是得自建。但如果你只是想让 Agent 能"搜一下最近大家在聊什么",这玩意儿 5 分钟就能跑起来。