为什么你的AI项目没帮你找到工作

我曾指导数百人进入人工智能领域,也见过许多有抱负的人工智能工程师因为构建了不合适的项目类型而最终找不到工作。

为什么你的AI项目没帮你找到工作
AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo

想知道入门级人工智能工程项目与 Claude 和 Codex 团队构建的系统之间究竟有何区别吗?

两者之间的差距看似巨大,但实际上大多数人工智能工程师都遵循着一个相当清晰的进阶路径。

今天,我将梳理人工智能工程项目的五个层级,正是这些层级将完全的新手与该领域的顶尖人才区分开来。

我曾指导数百人进入人工智能领域,也见过许多有抱负的人工智能工程师因为构建了不合适的项目类型而最终找不到工作。

读完这篇文章,你将清楚地了解自己目前所处的阶段,以及需要哪些具体技能才能达到下一个级别。

1、等级1

在等级1,你正在使用语言模型API和某种简单界面构建产品。例如,回答客户问题的聊天机器人或为你总结文章的小功能。大多数时候,你只是使用OpenAI或Anthropic API,并在其前面放置一些快速的东西,如Streamlit应用。

你花时间在提示工程上,但不一定跟踪或测试你的提示。你有一些结构化输出,也许还有一些测试来确保它正确解析,也许你甚至已经放置了一些逻辑来处理模型出错时的后备方案。

如果我是一个绝对的初学者,想要达到这个水平,我会从一些免费的YouTube教程开始,了解有哪些工具以及它们如何组合在一起。

然后我会花一个周末构建一些帮助我解决现实生活中的问题的东西,比如一个膳食准备教练。

但问题是,无论你构建什么,可能只有在它工作时才能工作。因为你没有跟踪你的提示,你不知道你的更改是否真的有帮助。你没有指标来评估输出的质量。你的机器人只知道它被训练过的内容以及它能在网上找到的任何内容,这意味着它缺少公司可能拥有的许多有用上下文。

2、等级2

当你开始解决这些问题时,你就达到了等级2。你知道你需要构建一个更健壮的系统,也许你被要求创建一个可以使用团队内部文档的系统。

因此,你开始向项目添加检索增强生成。这允许模型与内部知识库交互,为其提供如何回答特定于团队或公司的问题的上下文。

但仅仅添加RAG是容易的部分。困难的部分是知道它是否给你正确的答案,如果它搞砸了,弄清楚原因以及如何修复它。

这意味着理解如何正确地分割文档,如何正确嵌入它们以便可以将它们存储在向量数据库中,以及我们可以在新问题到来时使用的所有不同方法来找到正确的块。

这也意味着为系统的每个组件以及整个系统设置非常专业的评估方法。不仅你需要知道使用什么指标,你还需要知道什么看起来是好的,以及你将如何衡量响应是否真正满足客户需求。

如果我想从等级1达到这个水平,我会获取我已经构建的聊天机器人,并将其连接到模型从未见过的东西,比如对于那个营养教练代理,我可能会分享我的营养日志或最喜欢的家庭食谱。

一旦你完善了这个,你将拥有一个真正有用的AI系统。你将能够询问有关自己数据的问题并获得自定义响应。不仅如此,你将完全确信你构建了一些有用且准确的东西。

这一切都很好,但当你想更进一步,让AI实际使用这些信息做一些事情时会发生什么?

3、等级3

一旦你开始构建更复杂的AI系统,自然的下一步就是希望你的AI能够采取行动,而不仅仅是回答问题。这带我们进入第三等级:AI代理。

代理是可以使用工具并自己做决定的模型。你给它一个目标,它就在一个循环中工作,决定做什么,采取行动,检查结果,并找出下一步行动,一遍又一遍直到工作完成。它可以做诸如搜索网络、调用其他API、运行代码或更新数据库之类的事情。

在实践中,这可能是一个研究代理,从数十个来源收集信息并帮助你撰写简报,或者一个客户服务代理,自己查找订单并处理客户请求。

在我看来,这是目前AI工程中最有趣的东西,但它也是最危险的东西之一。

因为你给AI代理的每一点权力都是事情出错的又一次机会。回到等级二,评估意味着对单个答案进行评分,但现在你正在对一大堆不同的决定进行评分。如果代理在任何步骤中走错路,之后的一切都建立在那个错误之上。

更不用说,当你的代理在信用卡、代码或电子邮件上犯错误时,会有真正的后果。风险本质上要高得多。

一旦你能构建一个负责任地处理所有这些的代理,你就拥有了真正强大的东西。你的AI可以为你完成完整的多步骤任务,从头到尾,为你节省数小时的工作。构建一些出去实际做事的东西真的很有趣。

如果我从等级二进行这种转变,我会从给我已经拥有的系统一组真正的工具开始,但一开始我会将它们保持为只读。所以假设我仍然在做那个营养教练:代理可以搜索我的膳食日志,使用营养计算器,并搜索网络,但它还不能改变任何东西。

然后我会让循环工作,代理决定,采取行动,检查结果,然后再次行动,跨所有这些工具。我会确保我有可观察性工具,并确信代理可靠且安全,然后才给予它更多功能。

但在一个对你有用或作为内部工具的单个代理,和一个可以被可能数百万用户可靠使用的多代理系统之间,仍然存在差距。

4、等级4

这带我们进入第四等级:企业级AI系统。当人们谈论年薪超过30万美元的AI工程职位时,这些人正在构建的就是这种系统。

你不是让一个代理尝试做所有事情,而是有一群专门的代理互相交接工作。也许一个代理分解请求并路由它,其他几个代理各自处理自己的部分,另一个代理在工作提交之前检查它。

在实践中,这可能是一个客户服务系统,其中一个代理审查和路由工单,一个计费代理和技术代理处理它们的部分,最后一个代理在客户看到之前审查整个响应。所有这些同时为数百万人运行。

但协调一个代理团队与运行一个代理是完全不同的野兽。你添加的每一个代理都是另一个可能出错的东西,一个代理的错误会直接传递给下一个。现在它是实时的,在真正的客户面前,一个糟糕的响应是公开且昂贵的。

有趣的是,当研究人员查看Claude Code背后的代码时,实际的AI只是其中的一小部分。几乎所有其他内容都是保持整个系统可靠的脚手架。

因此,这个等级的大部分实际工作是围绕代理的一切。除了所有先前等级的内容,如结构化提示工程、RAG和评估之外,这可能是诸如跟踪之类的东西,以便你可以在出现问题时确切地看到每个代理做了什么,以及防护栏,这样没有人可以欺骗代理泄露数据。更不用说保持成本和延迟在控制之下。

如果我要从等级三跳到等级四,我会把我的营养教练分成一个小团队:一个代理计划膳食,一个代理构建购物清单,甚至可能为我订购杂货,还有一个检查代理在我看到计划之前审查它。然后我会故意尝试打破它,比如给规划者一个假成分,看看检查器是否真的捕捉到它,或者只是让它通过。数百万用户的部分老实说你只能在工作中构建,但我们仍然可以通过构建在云服务上并从一开始就考虑成本和可靠性来构建可以扩展的东西。

一旦你能构建在规模上经受住考验的代理团队,你就构建了公司可以实际运营其业务的东西,并将获得与其价值相称的薪水。

但即使在等级四,你和你的团队仍然是构建所有这些东西的人。你是瓶颈。

5、等级5

所以在等级五,你让自己不再挡路。这是目前AI工程中最先进的工作,你停止手动构建系统,开始让代理自己构建它的工作。

这远远超出了仅仅使用编码代理来编写代码,这在每个等级都会做。它甚至超出了规范驱动开发,你告诉代理你想要什么并让它自主实现。

构建Claude Code和Codex的顶级团队不再指导代理进行每一次更改。他们已经开始构建自我改进的系统。这个想法是建立一个循环,代理查看系统的性能,提出可能使其变得更好的更改,进行该更改,测试它是否真的有帮助,然后保留它或丢弃它。然后它再次做整个事情。一遍又一遍。持续数小时甚至数天,没有人介入。

Andrej Karpathy运行了一个项目,其中一个代理在两天内完全独立地进行了大约700次实验,并提出了二十种使模型训练更快的方法。Anthropic最近分享说,合并到他们自己代码库中的大部分代码现在都是由Claude编写的。它开始自我构建。

整个循环只有在代理能够一次又一次地正确判断自己的工作,而没有人检查的情况下才有效。而事实证明,这很难正确做到。

因为如果你的评分 even a little bit off,代理就不会修复产品。它会发现你评分中的缺陷并利用它,在实际产品以你从未想到测量的方式变差的同时获得高分。

所以这个等级的技能是认真的。你必须设计一个代理无法作弊的评估,并确保其性能与真正使产品良好的东西挂钩,这样它就不能 just manipulate an easy number。你还需要为所有内容设置工具,因为你不再能实时观看它运行,你只能读取它留下的痕迹。最后一部分是知道人类仍然需要介入的地方,因为即使世界上最好的团队也不是完全放手的。人们仍然选择问题,设计评分,并批准实际投入生产的内容。

所以这不是你通过自学几周就能达到的水平。这里的每一项技能都是你通过多年实际运行生产系统、看到它们出错的方式以及随时间变得更好而学到的。

幸运的是,我们大多数人实际上不需要达到等级5!我在Twitch上大部分生产AI系统的工作实际上是等级2或3。有时你只需要一个做得好的提示和一些简单的评估来构建有用的东西。我们被雇佣是为了有用,而不是花哨。


原文链接: Why Your AI Engineering Projects Won't Land You a Job

汇智网翻译整理,转载请标明出处