跳到主内容
开元娱乐平台

20亿,阿里领投一位90后实习生:给AI当老师

2026-09-15 · 潘一鸣 · 更新于 2026-09-18

一家成立不足一年的AI企业,正获得接近20亿元的资金注入。

据相关报道,阿里巴巴计划领投UniPat新一轮大约3亿美元的融资,腾讯与红杉中国等机构也参与其中,该公司估值约25亿美元,换算成人民币接近170亿元。

UniPat的工作是为AI系统出题、评分,并指出模型在哪些地方出现了错误。

这项业务已经开始产生可观的收入。

2024年,AI数据与评测公司Surge AI的收入约为12亿美元;Mercor今年公布的年化总收入已超过20亿美元;Scale AI去年的收入也接近10亿美元。

- 01 -一年内涌现三家十亿美元级业务

UniPat成立于2025年末。创始人李宽是90后,本科毕业于北京航空航天大学,硕士毕业于中国科学院计算技术研究所,目前在香港科技大学计算机科学与工程系攻读博士,研究方向涵盖LLM Agent。创业前,他曾作为实习生在阿里通义DeepResearch参与后训练研究,重点包括数据合成和强化学习。

后训练要解决的核心问题之一,是让已完成预训练的模型持续“提升能力”。模型能做多少题并不足够,训练团队还需要知道:什么样的答案算好,错在哪里,哪种反馈最值得用于后续训练。

UniPat将这一过程转化成了产品。一位在头部大厂负责AI智能体项目的负责人向铅笔道表示,UniPat替代了智能体研发项目中原本测试团队的工作,将整个评估流程打包成产品,用于衡量AI任务执行的完整程度,切中了市场刚需。

目前最直接的盈利方式,是将专业人员的判断出售给大模型公司。

Mercor为OpenAI、Anthropic、Google DeepMind等机构组织程序员、律师、金融从业者和科学家,让他们出题、撰写答案、评价模型输出,再将数据交给客户用于后训练。该公司最初从事AI招聘,后来发现,最愿意为高端人才付费的是大模型实验室,于是转向了AI训练领域。

据Forbes报道,Mercor今年6月的年化总收入超过20亿美元,相较于2月的10亿美元翻了一番。公司今年上半年总收入约6.14亿美元,其中约91%来自基础模型公司。

但这20亿美元并非纯粹的软件收入。大约60%至70%的流水需要支付给专家。Mercor赚取的是撮合差价,关键在于快速找到合适的专家并控制交付质量。

Handshake走的是相似路径。它原本是一个大学生招聘平台,拥有高校、学生和校友网络。2025年切入AI训练后,不到一年,这项业务的年化总收入接近10亿美元;扣除专家报酬后,年化净收入约为3亿美元。

Surge AI则更像一家高毛利的数据服务商。创始人Edwin Chen曾在Google、Facebook和Twitter工作。公司2024年收入约12亿美元,客户包括Google、Meta、Microsoft和Anthropic。

Surge同样出售人类反馈和高质量数据,但它将业务推向更高价值的环节:不仅仅是找人做题,而是设计任务、评分标准、评测集和训练环境。相比单纯的人力撮合,这更接近一套AI后训练服务。

这几家公司赚的是同一笔钱:模型越强大,就越需要更专业的人来告诉它哪里出了错。

- 02 -好答案,价值不菲

行业之所以从标注转向评测,原因很简单:模型越来越擅长应对考试。

早期训练数据的问题是“是否有答案”。如今的问题变成了“什么答案才算真正好”。让AI识别一只猫,可以用一个标签解决;让AI修改一个大型代码仓库、做一份投行分析、完成医院行政流程,很难仅用“对/错”两个字来评分。

这时,评分标准本身就成了数据。

UniPat今年推出的ExpertEval覆盖医疗、金融和法律三个领域,共包含3213个专家案例、207个场景,每个案例平均设置了21.83条评分标准。它不仅关注结论,还检查证据、推理过程和高风险错误。这些评分结果可以继续用于后训练。

它的Monthly-SWEBench则每月从最新关闭的GitHub任务中抽取题目测试模型。题库必须不断更新,因为公开Benchmark很快会被“刷题”:分数上涨,并不代表真实工作能力同步提升。

它的SaaS-Bench更贴近真实工作场景。UniPat将Agent放入23套可运行的SaaS系统中,要求完成报销、关账、项目管理、医疗行政等任务。结果显示,目前最好的模型虽然能完成不少中间步骤,但端到端完全完成任务的比例仅为3.8%。

这3.8%恰恰是这类公司的商机所在。如果Agent已经能稳定完成99%的工作,评测公司的价值反而会下降。正因为模型频繁失败,AI实验室才需要不断寻找新题目、发现错误、设计评分规则,再将失败样本送回训练。模型每升级一次,这个循环就可能重新开始。

Scale AI也经历了类似的升级。它从自动驾驶数据标注起家,后来进入高质量训练数据、模型评测、红队测试和政府项目。2025年,Meta斥资143亿美元取得了其49%的股份,公司估值升至290亿美元。

这类公司的价值在于能否持续发现模型不会做的事情,再把失败原因转化为训练信号。模型每升级一次,新的评测和训练需求就会再次出现。

- 03 -下一笔资金流向

行业正在寻找比“按人头卖数据”更好的商业模式。新的方向被称为RL Environment,即强化学习环境。

可以把它理解为给Agent搭建一个“模拟公司”。里面有邮件、CRM、代码库、财务系统、客户工单和各种工具,AI不仅要回答一道题,还要连续完成几十甚至几百步操作。系统再根据结果自动打分,让模型反复练习。

这比传统标注更难,也更接近软件产品。传统模式需要不断招人、派单、验收,收入增长往往伴随人工成本增长;训练环境一旦搭建好,可以被不同模型反复调用,并持续生成新的训练轨迹和反馈信号。

Surge已经成立专门团队建设这类环境。今年它发布的EnterpriseBench CoreCraft模拟了一家客户支持公司,包含2500多个实体、23种工具,让Agent处理多步骤工作。Mercor也在7月收购了专门做强化学习环境的Deeptune,并明确将编码、医疗、法律等领域的训练环境作为下一阶段业务。

Handshake则开始将另一种稀缺资源拿出来出售:企业真实运营数据。它公开向企业征集经过脱敏的业务数据,根据数据规模和价值,一份合作可支付10万至400万美元以上,再将整理后的数据提供给前沿AI实验室用于训练和评测。

这说明这门生意正在形成三层收费模式:第一层出售专家时间,第二层出售整理好的训练数据和评分标准,第三层出售可以持续产生训练数据的环境。越往后,越接近基础设施。

当然,这门生意还没有摆脱人力服务。Mercor约六至七成流水需要支付给专家,客户又高度集中在少数头部AI实验室;Scale在Meta入股后遭遇部分客户关系变化,也说明“中立第三方”本身就是一种资产。

本文不构成任何投资建议。

本文来自微信公众号“铅笔道”(ID:pencilnews),作者:松格,编辑:黄小贵,36氪经授权发布。

更多文章