LOADING

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

“野蛮生长的阶段已经过去了。”

这是身处硅谷AI创业一线的马培元最近最深的感受。

2021年12月,本科毕业后,他进入号称“美版知乎”的Quora,后来转到AI聊天机器人聚合平台Poe,担任资深AI工程师。2个月前,他又加入硅谷最热门的AI Agent创业公司之一Cognition。

2026年5月,这家成立不到三年的公司宣布完成超过10亿美元融资,估值升至260亿美元。8个月前,它的估值还是102亿美元。

除了工程师,马培元还有另一个身份——投资猎头(Venture Scout)。他替投资机构寻找值得下注的AI创业项目,每年拥有50万美元的投资额度。

毕业后的这四年多的时间里,他似乎始终行动得要比AI行业共识早,在“agent”这个词还没有被任何人讲清楚定义之前,他所在的团队已经悄悄立项。在Anthropic还是无名之辈时,他们就成了Claude最早的深度用户。他是团队里第一个AI认证工程师、第一个AI agent工程师,后来又把整个工程团队“洗脑”成了使用AI编程的AI Native团队。

这种认知和行动的超前,最有意思的印证发生在两周前,他在和“未来人类实验室”对谈时随口说出“people manager正在消亡”,没过多久就被腾讯、字节宣布取消中层的新闻坐实。

变化发生得太快,在硅谷,要时刻与变化共处。

在这篇稿子两次访谈的两周间隙里,马培元发现自己上一次讲的硅谷“追逐最贵最前沿模型”的逻辑,就开始站不住了。当下硅谷流行的做法是把多个便宜模型和顶尖模型“融合调度”使用。

和马培元聊了近5个小时,我们发现,他几乎一直在推翻昨天的自己,硅谷也一样。“我不能说所有的,但你可能说大于60%,一个月之后就可能又反着来了。”

过去几年,AI几乎改写了硅谷的所有默认规则:什么样的人更容易脱颖而出,什么样的组织更有竞争力,什么样的钱花得值。

当然,这些所谓“正确答案”的判断,也在迅速失效。在AI领域,一年已经是很长的周期,很多判断可能在一个月内就被推翻。

以下,是马培元眼中十分当下的10个硅谷AI观察:

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

马培元

 

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

硅谷需要什么样的人才?

马培元的职业画像,高度契合了硅谷的AI公司最喜欢的人才样貌。他不是传统的计算机背景,没有得竞赛金牌,没有顶尖名校光环,甚至一度对计算机毫无兴趣,但过去四年,他从Quora的广告组一路做到Cognition的AI工程师,履历踩中了硅谷AI公司现在最想要的人才画像的每一个关键词。他的经历,既是一部个人成长史,也是一份行业招聘标准变化的样本。

观察1:通才碾压专才

硅谷现在最抢手的人才画像,不是某个领域钻得最深的专家,而是“每一项都过得去、没有明显短板”的人——业内管这个叫polyglot talent,更通俗的话说叫“六边形战士”。

2024年,Poe内部启动了一个当时还没人说得清定义的“agent”项目,组里挑中我这个新人的理由很直接:“既做过AI,也做过全栈开发和iOS”。当时组里其他人大多是传统机器学习、搜广推背景出身,他们的人不懂前端代码,而agent恰好需要能写前端界面。公司原本负责AI提示词工程的人离职后,团队里再没有人能补上这个缺口,那正好,反正我学得快,我既做这个agent提示词工程,也做这个它的前端写代码之类的。

这套“什么都会一点”的能力组合,后来变成了我找工作时最值钱的资本。我是你给我一个什么新的领域,我可以从两周之内学得差不多。而这正是早期创业公司要的人。

观察2:AI原生技能,可以在短时间内碾压资历年限
AI工具的使用能力,可以直接碾压传统意义上靠年限堆出来的资历。

我从Quora广告组转去iOS组的时候,理由是“想迈出舒适圈”,但此时我对iOS一窍不通,是彻头彻尾的“0年经验”。我当时没有选择慢慢补课,而是把GPT-4当成了自己的搭档。当时我周围的人都是非常资深的iOS工程师,他们可能不信AI。我iOS不会写,Swift代码不会写,于是我就疯狂地用AI帮我写代码。

结果是,我这个刚入行三四个月的新人,产出速度追平甚至超过了身边浸淫多年的资深工程师,两年内就做到了资深职位。这在传统晋升体系里,几乎是不可能的速度。此前,在Facebook可能至少要4到6年,你才能变成资深工程师。谷歌有些人可能一辈子都不会升级到资深工程师。

我在Cognition就遇到过一位19岁的面试官。一开始我还有点沮丧,一个26岁的人被19岁的人“拷问”,很多问题我都答不上来。后来我意识到,这恰恰是一个迹象,说明这家公司确实能不拘⼀格降⼈才,且年龄不再是硅谷评判人才的标准。

观察3:招聘标准被彻底重写,AI公司不用同一套模板面试

我在Quora离职前,认真面了将近20家公司,算上打过电话的有30到40家。最多的时候,我一周被30多个猎头找上门来。

面试了这么多家公司,我发现,当下AI公司招人没有一个统一的面试模板。

但有几个很明显的变化,LeetCode式算法题的重要性在下降,关于AI系统设计的最佳答案每个月都在改变。

面试结构也在变化。在线笔试+work trial成了一种新的组合。work trial是一种非常短的“试用期面试”。有的3小时,有的5小时,最长也就一两天。我遇到的一次面试,就是直接给我一个代码库,让我用任何工具,包括AI,去解决一个实际问题。做完之后,还要展示思路和成果。整个过程已经非常接近真实工作。

更有意思的是,对AI使用的考察本身也被拆成两种模式。有些轮次要求必须用AI,看你怎么“by code”;但也有轮次明确禁止使用AI,比如debug,考的是在没有AI辅助加成下,你能不能找出错误,本质上是在测试个人实际的软件⼯程⽔平和品味如何。

面试本身也多种多样。比如,有的公司会让我做商业分析,判断他们应该收购哪个行业。

行为面试(behavior round)也变了。它不再是“个人最⼤的缺点和优点”“跟同事有冲突怎么解决”等传统问题,而是拉长时间线,去看一个人的成长轨迹,从高中到大学,从实习到工作,一路往下追,看你的“人生斜率”,判断你是不是⼀个能够指数型增⻓的⼈。

没有标准答案带来的一个意外好处是:没人能靠背题拿到offer。连我在Cognition的内推人都直接告诉我:“你别准备了,我觉得没什么可准备的。”

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

AI正在重构组织结构

在硅谷,最厉害的那批人,从来不属于某一家公司,只属于“那个时代最厉害的公司”。二十年前是谷歌,十年前是Uber和Robinhood,五年前是Coinbase,现在是AI公司,硅谷是“流水的银盘,铁打的兵”。这批被新标准筛出来的人才,更会因使命感,而不是“待遇”留下。这些汇聚最厉害人的组织,也在AI的重塑下,发生着巨变。

观察4:对“AI原生”太过渴求

硅谷公司对AI原生(AI native)的渴求程度远远⼤于我的想象。我面试的公司大多是A轮、B轮,也有一些种子轮。一个很高频的问题是:你用什么AI工具?我通常直接把自己写的博客丢过去,对方基本上都会“目瞪口呆”。

他们会说,不只是想让我做AI应用开发,更希望我去推动公司内部的AI转型,让团队变得更AI原生。很多公司其实已经在做AI产品,但员工还没有建立自己的AI工作流。而且,他们也很需要每天都刷很久推特、及时分享⼀些新奇AI发现或提效技巧的⼈。

这件事对我来说有点反直觉。我过去的一些“爱好”,比如每天折腾Claude Code等新工具、在Slack(一款办公软件)里分享AI用法,反而变成了一种新的组织角色。

之前在Quora时,我成功地让整个⼯程团队都⽤上了Claude Code。办公室每遇到⼀个⼯程师,我都会问,你有没有⽤AI来编程?我记得办公室⾥有一个做网络安全的工程师,一开始很抗拒,觉得用AI写代码风险太高。我后来让他换个思路,不写代码,只用AI读代码、理解代码库、做数据分析。后来,他也真的用起来了。

观察5:“更好地去使⽤AI”,实质是个组织转型问题

在Cognition做AI相关工作时,我越来越发现一个事实:更好地去使⽤AI,可能已经不是⼀个纯⼯程问题,而是⼀个组织架构上的转型问题。

举个例子。传统组织架构的互联网公司,一个Bug从发现到修复,往往要经过需求评估、工程排期、开发、测试、上线等好几个环节。真正用AI写代码可能只需要两三个小时,但整个流程走下来,经常要一个月。

以前这样的流程是合理的。因为修一个Bug,一个工程师可能要花三五天,流程的价值在于协调不同团队、分配资源。但AI把这个时间压缩了。

现在,我们用Cognition推出的Devin这样的AI软件工程师产品,两三个小时就能完成过去几天的工作。在Cognition,我们甚至可以用Devin找到负责这个Bug的人,再让Devin协助他完成修复,中间很多协调和流转环节都可以省掉,没有任何冗余。其实是AI在倒逼整个组织架构的转型。

观察6:People manager正在消亡,管理者必须自己会写代码

所谓people manager就是⼯程经理(engineering manager)。在美国,近⼏年来流⾏的⼀个观点是,你作为管理者就要做好管理,更多负责团队协调、组织沟通,照顾员工情绪、提供成长支持,工程能⼒不用特别强。

但进到Cognition,我发现整个组织架构⾮常扁平化。比如,我直接汇报的对象甚至是CPO,也就是联合创始人之一。他不会细致关心你的个人成长,角色更像是确定大方向。甚⾄可以这么说,Cognition现在60多人的工程团队里,真正的people manager只有一个人,其他的包括CPO在内,都是“既管人、也写代码的”。这和我之前在Quora的体验完全不同。当时,一个manager可能要管五六个工程师。

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

Cognition团队集体穿上红衣服为一位日常爱穿红色衣服的同事庆生

我觉得这可能是AI带来的组织架构变化。我观察到,任何⼀个朝⽓蓬勃的AI创业公司,其实都是这样,⼏乎没有只负责管⼈的经理——如果他管⼈,他⼀定技术也很强。

这个判断不仅仅发生在硅谷,在间隔两周的两次访谈之间,国内大厂腾讯、字节也先后宣布取消中层。

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

AI时代,任何判断都会很快被推翻

马培元观察到的变化,不只停留在组织层面。更宏观的行业判断:“在硅谷AI公司内部,什么样的Token支出算合理,什么样的模型才是好模型?”同样在以肉眼可见的速度被推翻。这一次,连他在第一次采访时说过的判断,都没能扛过两周。

硅谷的AI行业本身也在以月甚至以日为单位自我推翻,没有什么判断能保鲜太久。

观察7:Token Maxxing出现了分化,大公司开始重新关心效率

今年初,硅谷一度流行“Token-Maxxing”。Meta等公司一度甚至做过Token使用排行榜。谁用得最多,谁就是“AI原生”的代表。我觉得这⾸先就是一件很蠢的事情——AI token的使⽤量跟⼯程师的效率不能画等号。

Google、Meta的朋友还跟我说,他们当时都在搞“AI大跃进”。公司会专门办“AI Week”,所有人都要停下手里的工作,去写AI Skills,把自己的Skill包装得天花乱坠。

一开始,几乎所有公司都是这个思路:先让大家尽可能多地用AI,看看到底能用到什么程度。

但一旦变成公开排名,人的行为就会被扭曲。工程师会为了“用得多”而用,甚至出现一些很荒诞的情况,比如让AI每晚定时乱跑、空跑一些没有意义的任务,只是为了增加使用量。这其实和用GPA去衡量学生能力一样,单一指标很容易失真。

后来很多高层也开始意识到这个问题。更具体的是,他们被账单吓到了。比如Uber,2026年全年的AI专项预算,前四个月基本就烧完了。很多大公司开始重新限制Token用量。董事会和CEO会开始问,这个token⽤量真的值吗?它真的能让我们提升这么多效率吗?⼀个亿美⾦花下去,它真的带来了⼀个亿的产出吗?

这场焦虑很快被Cognition做成了一份可以明码标价的商业答卷。6月4日,Cognition发布了“AI生产力保证”——如果企业客户使用Devin(Cognition推出的AI软件工程师产品)后,效率提升没有达到承诺水平,最高赔偿1000万美金。做这份研究的,是我一位拿过三块国际信息学奥赛金牌的同事,他调研了233个真实客户案例,随机抽取客户和Devin的对话,问客户“如果不用Devin,这段工作纯人工要花多久”,再用这些数据训练出一套预测系统,把每一次Devin对话,直接转化成“等效工程师小时数”,用工程师的时薪反推这套产品到底省下了多少。

但很多YC公司,可能还会继续“token maxxing”的模式,因为他们有很多政策优惠的免费token额度,再加上规模小,可能只有三个人,没有什么AI治理的问题,管理者能直接看到每个人到底是不是在用AI摸鱼。

观察8:模型崇拜本身也在被推翻

就在这篇稿子两次访谈的两周间隙里,我发现自己上一次讲的道理,已经开始不太对了。

两周前,我还在谈论哪个模型是当下最前沿的。现在,Cognition内部刚刚发布了一个还没有中文译名的功能,代号叫fusion mode——把多个便宜模型和顶尖模型融合调度使用,而不是无脑调用最贵的那一个。你不会天天开你的保时捷去买菜吧,你应该去开你的本田或者便宜的车去买菜。这两周模型迭代的速度也超出了我的想象,连谁是“number one”这件事,都不敢说得太满。

我不能说所有的,但你可能说大于60%,很多可能是一个月之后就可能又是反着来的。

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

AI时代,“机会”藏在非共识里

任何技术浪潮演进的规律都是如此,旧共识破灭,往往正是新范式建立的开始。

当市场告别了对单模型和算力烧钱的盲目崇拜,围绕“如何让AI稳定可控地落地”以及“如何啃下大模型啃不动硬骨头”的需求便爆发出来。兼具工程师与投资猎头双重视角的马培元注意到,一批不依赖“大模型神话”、专注于解决真实世界复杂痛点的新生意,正在硅谷的非共识中悄然萌芽。

观察9:新的AI infra正在出现

围绕“Token-Maxxing”,其实已经出现了一批新的创业公司。他们专门观测、监控团队的AI使用情况,分析哪里在浪费token。

这背后更深一层的问题在于,AI agent本身是脆弱的。一个prompt的微小变化,就可能导致agent的表现变差了。于是新的AI infra(基础设施)开始出现,比如sandbox(沙盒环境),用来隔离agent运行,避免它直接接触敏感系统,比如银行账号或生产环境数据。

与此同时,“观测”本身也变得更复杂。传统系统只要报错就能被监控,但agent不会“报错”。它可以正常运行,却可能在输出层面出现严重问题,比如带有偏见、歧视,或者让用户产生明显负面体验。这就需要⼀套新的软件,去监测agent什么时候“脑⼦坏了”。

观察10:“不可训练的东西”,正在成为新生意

投资圈里有一种越来越流行的判断:vertical agent(垂直领域AI代理)已经失去投资价值。但我并不完全同意。

硅谷投资者郭睿(Sarah Guo)提出过一个概念——“the untrainable”,也就是“不可训练的东西”。核心观点是在很多垂直行业,语言模型永远无法完全自动化。因为垂直行业里充满大量无法被抽象掉的复杂流程,而且这些流程往往需要⼈⼒来不断地⼀个个解决。

比如美国报税,50个州有50个税,要一一慢慢对接;法律领域也是如此,移民法、民法、商法,各自体系复杂,AI agent没法一步到位。

垂直AI agent公司的价值,就在于不断和客户、FDE(前沿部署工程师)的互动中发现更多真实的痛点。这些东西会被烙印在公司的产品⾥,这也是其他⼤公司没有办法训练、不能被通⽤模型吃掉的东西。

所以,我倾向于认为vertical agent依然有投资价值。只是它们带来的可能不是1000倍的回报,而更可能是20倍、50倍,甚至100倍这种比较稳、比较小的回报。

© 版权声明

相关文章