Featured image of post 当950个Agent搜完20万条DNA:一个人的千军万马路线图

当950个Agent搜完20万条DNA:一个人的千军万马路线图

Anthropic用950个Agent在21小时里筛完20万个逆转录酶,斯坦福用3.7万个Agent虚拟员工扫完5万项临床试验。拆解这两个案例背后的大规模Agent工作流选域逻辑:验证成本、搜索空间、数据可得性三个过滤器,以及计算机背景的个人开发者已经跑起来的四条赛道和它们的排序。

950个Agent,21小时,2.1亿token,20万个候选对象,最终交给人类的只有20个。大规模Agent工作流的价值不在Agent数量,在于你选的领域满不满足一个条件:机器粗筛便宜,人类验证也便宜。这篇文章把我筛领域的三个过滤器和已经在跑的四条线全部摊开。

950个Agent,21小时,20万条DNA

Anthropic今年成立生命科学研究组之后,公开了第一项成果。他们让950个Claude Agent进入庞大的DNA数据库,寻找此前没有被认识清楚的逆转录酶系统。逆转录酶干的事是把RNA信息复制回DNA。

21个小时里,这批Agent消耗了2.1亿token,收集超过20万个逆转录酶,筛出3500个候选系统,再收敛到20个重点分析对象。

转折发生在一次例行检查。一个Agent在检查某个候选对象附近的DNA时,注意到一串排列整齐的重复序列,停了下来。这种排列长得像CRISPR。噬菌体里的逆转录酶本身早被人研究过,只是没人注意它旁边连着一个功能未知的基因,加一长串间距均匀的DNA重复序列。Claude把三者当成一个完整系统看,Anthropic把它命名为ART,阵列相关逆转录酶。后续实验发现ART阵列同样会表达一组短RNA,类似的可编程机制也许存在于其中。

注意边界。Claude完成的是数据库搜索、候选筛选与分析,所有湿实验由人类科学家亲手完成。ART能不能切割、复制、粘贴DNA,目前没有答案。

3.7万名虚拟员工的药企

Claude发现ART的一周前,斯坦福大学医学院干了一票规模更大的。他们按真实药企的组织结构搭了一家虚拟生物科技公司:3.7万名AI员工,一个首席科学官管理不同部门,分别找药物靶点、分析临床数据、设计药物、规划试验。没有办公室,没有工资,没有午休。

研究人员把约5万项临床试验分给Agent,每个Agent只负责一项,系统汇总。不到一周,它们发现一组与药物成功率相关的特征:靶点集中存在于特定细胞中,且基因活动更像开关而非可缓慢调节的旋钮,这类药物从一期进入二期、最终上市的概率更高,副作用更少。

接着他们让Agent针对肺癌靶点B7-H3设计治疗方案。Agent提出制造抗体药物偶联物,找到带B7-H3的细胞,把化疗药物直接送到附近。几个月后,一家真实药企独立提出了相同的治疗思路,该药物随后获得FDA突破性疗法认定。

第三条线已经进了人体。英矽智能的Rentosertib用于特发性肺纤维化,AI参与发现了靶点TNIK,又生成并筛选了候选分子。今年9月的新研究重新分析了二期临床的血液样本:42名参与者,12周完整数据,六套蛋白质衰老时钟。六套时钟测到同方向的变化,接受治疗后患者的预测生物年龄下降了。研究者自己也承认,没法完全区分这种变化来自疾病改善还是药物真干预了衰老。

两个案例,一个模式

把三个案例放在一起,结构完全一致:

环节Anthropic ART斯坦福虚拟药企
粗筛950 Agent扫20万逆转录酶3.7万 Agent分5万临床试验
收敛3500候选 → 20重点全公司汇总出靶点特征
人类验证湿实验做ART的RNA表达真实药企独立走通B7-H3路线
耗时21小时不到一周

机器负责的是「可能性生产」,人类负责的是「可能性裁决」。原文那句话说得很准:提出假设正在变快,验证假设仍然必须等待细胞生长、动物实验、伦理审查和人体试验。AI一次产生几千个看似合理的答案,问题变成我们有没有足够的实验、时间和耐心去逐一确认哪些是真的。

这就是个人开发者选领域的全部依据。

选领域先过三个过滤器

我想建立一套千计Agent的工作流,让它持续寻找人类需要大量时间才能找到的东西。计算机本科加硕士的背景,能落地的领域要用三条标准筛。

**过滤器一:验证成本。**Agent产出1000个候选,每个候选确认一次要花多少钱、多少时间。数据库检索类验证近乎免费,复现一个漏洞要跑PoC,湿实验要养细胞。这条是第一过滤器,验证贵的领域直接降低优先级。

**过滤器二:搜索空间。**对象总量要大到人类穷尽不了。20万逆转录酶、5万临床试验,这个量级才轮得到Agent上场。搜索空间小的领域,人自己就够了。

**过滤器三:数据可得性。**全部对象能不能被程序批量获取。公开数据库、开源仓库、公开裁判文书,都能。要授权的、要爬要买的,成本先涨一截。

按这三条筛,计算机背景能碰的领域排出来是这样:

领域搜索空间验证成本数据可得优先级
开源代码漏洞挖掘巨大复现PoC,贵全公开高
开源情报整合巨大交叉验证,便宜大部分公开高
政策补贴匹配大电话/文件核实,中公开但分散中高
专利与文献盲区巨大检索验证,便宜全公开中
药物临床数据再分析大需生物知识补课全公开低
足球赛事事件挖掘中人工看回放,中自采长线

已经在跑的四条线

漏洞赏金:验证最贵的那条

这条线已经跑了几个月:多Agent流水线选候选开源库,grep危险sink,本地最小复现,再写报告提交。GitHub安全实验室和huntr的赏金是变现出口,Google OSS VRP是补充。

它的优势是全部数据公开,GitHub上一个仓库一行代码都不缺。瓶颈同样清晰:一个疑似漏洞要真正变成赏金,必须本地复现成功,这一步AI只能辅助,裁决权在提交者手里。Anthropic那20个重点对象交给人类实验室,和我这里PoC复现通过才能提交,是同一个动作。

扩到千计Agent的方向很明确:粗筛层可以无限平行,一条流水线同时盯几百个仓库的依赖变更和diff,把「新引入的危险调用」这个事件源做成常驻监控。收敛层控制在几十个,验证层保持人工。粗筛与收敛的比例,参考Anthropic的20万比20,是万分之一。

开源情报整合:验证最便宜的那条

我给企业做的背景调查和竞品监控走的是这条路。多Agent分头拉工商、司法、招投标、招聘、新闻数据,汇总成证据卡,每个事实带出处。裁判环节用多模型对抗验证加独立判官,一个事实要过两道独立检查才算数。

这条线的验证成本接近零,因为验证方式就是交叉验证:三个独立来源对上了,置信度就够。它对应斯坦福那个虚拟药企的形态,按部门分工的Agent组织,产出给人类做最终裁决。

短板在信息差变现:结论的价值取决于问题问得好不好,问「这家公司值不值得合作」比问「这家公司怎么样」值钱十倍。产品化要往具体决策场景靠,投资尽调、供应商准入、合作方风控。

政策匹配:高信息差的中间态

政府补贴、园区入驻、人才认定这类政策,营销文章写的「最高100万」「最长3年免费」要拆解成真实条件。我做过的一套核验流程,把承诺拆成资格条件、兑现路径、申请成本三块,逐条对官方原文。

全国政策库分散在各级政府网站,量级够大,数据公开。Agent的活是全量扫描加结构化,把「谁符合什么政策」做成匹配引擎。验证靠官方文件和电话,中等成本。

这条线的信息差足够大,值得做的原因恰恰是搜索空间里全是没人整理完的东西。它和个人开发者的匹配度高,冷启动成本低。

足球数据:最慢的复利

比赛视频转结构化事件JSON,只存事件不存视频,规避版权。定位5到10年长期打磨,锚点西班牙Position Play方法论,差异化是独家业余赛数据资产。

Agent在这里的用法和前面三条不同,不是搜索,是标注和挖掘。视频先转事件,事件库积累到一定规模,Agent才能开始回答「这类传控打法在业余赛事里的成功率」这种没人答得了的问题。

验证靠人看回放,成本中等。这条线的价值在复利,时间越久数据资产越厚,别人从零追要重新录像。B2C数据供应链的想象空间在这里,急不来。

还没切但值得盯着的两块

**专利与文献盲区。**用Anthropic找ART的方式扫全量专利和论文,找未被注意到的技术组合。验证方式是检索确认「这个组合是否真的没人做过」,几乎免费。这条线的门槛在于产出如何变现:发现本身不值钱,值钱的是发现加落地路径。适合等前面四条线里有流水线闲下来时开一条实验线。

**药物临床数据再分析。**ClinicalTrials.gov全量公开,斯坦福已经示范了玩法。计算机背景的人切进去要补生物领域知识,补课成本高。我的判断是这条线留给别的人,盯住方法论的进展比亲自下场划算。

排序

现金流从漏洞赏金来,它验证最贵但回报最直接,而且已经在产出。产品和公司形态从开源情报和政策匹配来,验证便宜,信息差大,能做成B2B服务。足球数据是十年尺度的资产仓,持续投,不指望它短期回报。

千计Agent不是目标,是手段。Anthropic那个案例里,20万条DNA最后只留20条给人类。比例对了,规模才有意义。

一个留在这的具体事实:那家3.7万员工的虚拟药企,整理5万项临床试验用了不到一周。而其中的B7-H3方案,从Agent提出到真实药企独立验证出同样的思路,隔了几个月。差距就在这里,机器的时间和人验证的时间,差着三个数量级。千军万马值多少钱,取决于把这三个月压缩到多短。