过去两年,个人 agent 的能力上限被反复刷新——Codex 这类编程 agent、OpenClaw 这类开源个人助手、Manus 这类通用自主 agent,各自都能完成过去需要一个人半天的工作。但把它们搬进企业时,卡住的从来不是"做不到",而是五件与能力无关的事:它用谁的账号、数据留在谁手上、出事能不能追、花了多少钱谁看得见、经验能不能被同事复用。 这五件事构成了个人 agent 与企业数字员工之间的真实分界。一家公司什么时候该从前者转向后者,判据也在这五条里,而不在模型评测榜上。
个人 agent 强在哪,弱在哪?
先把优势说足。个人 agent 的形态有几个真实的、企业产品很难复制的优势:
- 零采购摩擦:装上就能用,不用走预算、不用等 IT 审批
- 能力上限高:跑在使用者本机,能碰到真实环境——本地文件、已登录的浏览器、内网可达的服务
- 迭代极快:开源的和闭源的都在按周更新
- 成本对个人透明:多少钱一个月,用不用得上,使用者自己判断
对于"让一个人变得更强"这个目标,个人 agent 是最优解,企业级平台在这件事上没有优势。
问题出现在从"一个人"扩展到"一家公司"的那一刻。下面五条不是产品短板,是形态决定的结构性缺口——它们在个人 agent 的设计前提里就不存在。
分界一:它用谁的账号?
个人 agent 用使用者的身份行动——你的登录态、你的 API Key、你的 SSH 密钥。这在个人场景里是效率来源,在组织里是三个问题:
- 责任链断了:它做的每件事在审计里记在"这个人"头上,出问题分不清是人做的还是工具做的
- 权限过宽:一个有管理员权限的人装了 agent,这个 agent 就有管理员权限——它不知道哪些操作该请示
- 人走了关不掉:能力绑在个人账号上,离职时要一个个排查
企业形态的答案是身份与权限分离。以我们的实现为例:数字员工用企业自建应用的机器人身份说话;访问业务系统时,网关以"发起人本人"身份铸造受限凭证,请求回环打进业务系统,穿过既有的鉴权体系,由业务系统在源头鉴权。权限不复制、不镜像,唯一真相源在业务系统。结果是数字员工永远读不到这名员工本人无权看的数据。
配套的一条纪律同样重要:事实 ≠ 权限。记忆里写着"某人拥有最高权限"只影响 agent 怎么理解对话,不影响它能做什么——这是防提示注入的关键,把话写进记忆换不来实际权限。
分界二:数据留在谁手上?
个人 agent 的数据落在使用者的机器和它所连的服务上。企业要问的问题更具体:
- 客户名单、成本结构、内部经营对话,进了这个工具之后还归不归我们控制?
- 语义检索用的 embedding 接口,是不是把每一条对话都发出去了?
- 多个客户合库时,隔离靠的是架构还是靠"每一行查询都写对了过滤条件"?
第三条是最容易被低估的。合库能省成本,但隔离性就从"物理上不可能泄漏"降级成"依赖正确性"。artux 的选择是一企业一实例:每家客户一套独立的服务与数据,不共用数据库;记忆、任务、审计全部落在实例内;同义联想所需的向量模型在进程内本地推理,零出网调用——代价是本地小模型表达力弱一些,所以设了双重相似度闸门兜住不确定性。
分界三:出事能追到哪一层?
"AI 又出问题了"不是可运维的粒度。企业需要的是定位到具体环节:是哪一次派发选错了岗位、哪一次工具调用超时、哪一条记忆写错了、哪一笔承诺没兑现。
这要求 agent 从设计上就把每一步落成可查的记录,而不是事后从日志里拼。artux 的做法是每一次派发、每一次重试、每一笔承诺、每一条记忆写入都留痕;运营侧的写操作强制归责到人,无身份的请求直接拒绝。记忆的撤回也不是裸删——立"墓碑"并在 30 天内主动告诉 agent"这条已作废,勿引用",因为单纯删掉记录管不住当前会话里已经形成的旧印象。
分界四:花了多少钱谁看得见?
个人订阅的成本对个人透明,对组织不透明。企业需要知道:哪个岗位、哪类任务消耗了多少额度;是不是有人拿它跑了本来该定时批处理的活;下个月要不要加席位。
席位 + token 额度的模型解决的就是这件事——额度归属清晰,超出部分按席加购,token 按积分补充。具体口径写在定价页上。这不是计费方式的偏好,是成本可归因的前提。
分界五:经验能不能被同事复用?
这是最容易被忽略、代价最大的一条。
个人 AI 工具越好用,一个反直觉的后果越明显:员工的效率提升会随着人的离开而离开。他调好的提示词、积累的上下文文件、摸索出的最佳路径,留在他的账号和他的电脑里。公司为这段学习曲线付了钱,但没有拿到资产。
企业形态要求记忆按归属而不是按内容组织。artux 切成三棵树:
- 员工档案树(每人一棵):你的偏好、你的文件、你要求的做事方式。今天是市场分析师服务你、明天换数据分析师,读到的是同一份
- 岗位经验树(每岗一棵):情报采集岗学到的抓取技巧,协同办公专员检索不到——那对它毫无意义,混在一起只会互相干扰
- 平台认知树(全平台一棵):编制名册、外部能力、哪条通道正受阻。总管派活前先看这个,受阻的通道不再派,并把实情讲给员工听
关键在于"改主意"而不只是"记住"。多数系统的做法是再记一条,于是库里躺着两条互相矛盾的记录。正确的做法是同一条记忆原地更新并保留旧值,审计里记 fact_updated。
结构性对比
| 维度 | 个人 agent | 企业数字员工平台 |
|---|---|---|
| 身份 | 使用者本人的账号与凭据 | 企业应用身份 + 以发起人身份铸造的受限凭证 |
| 权限边界 | 等同于使用者的全部权限 | 由业务系统在源头鉴权,不可绕过 |
| 数据落点 | 使用者机器 + 所连服务 | 企业专属实例内,语义检索不出网 |
| 记忆归属 | 个人账号 / 本地文件 | 组织资产,按人 / 岗位 / 平台三棵树隔离 |
| 常驻执行 | 通常需要人触发 | 定时任务 + 主动推送 + 承诺兑现 |
| 审计 | 平台日志 | 派发 / 重试 / 承诺 / 记忆写入全链,归责到人 |
| 成本可见性 | 个人订阅 | 席位 + token 额度,按组织归因 |
| 协作 | 一人一实例,经验不流转 | 同一份档案跨岗位可读,经验沉淀成技能 |
什么时候该转?三个信号
不要为了架构纯粹性提前迁移。出现下面任一信号,才是转的时点:
- 同一件重复劳动开始有第二个人做。一个人用个人工具搞定是效率;三个人各自摸索一遍,公司就在为同一段学习曲线付三次钱
- 有人开始把真实经营数据交给工具。客户名单、成本结构、内部对话一旦进入你无法确认边界的环境,事后补救的成本远高于当初选型多花的几天
- 出现"没人说话它也该动"的需求。每天定时的巡检、监测、汇总,是个人 agent 形态最不擅长的部分
三个信号之前,个人 agent 是更划算的选择——这一点我们不含糊。
FAQ
能不能用开源方案自己搭一套企业版?
可以,路是通的。要评估的不是"能不能搭出一个能跑的 agent"(那部分现在很快),而是搭出之后剩下的:多租户隔离、凭据不落地、记忆归属与改口机制、实例的开通升级健康上报备份回滚、席位与额度计量。这些是工程问题,占掉的时间远多于接一个 agent。我们自己花了 12 个月走完这条路,全过程记在《一家跨境家具公司的 12 个月 AI 自研之路》。
数字员工平台会不会限制能力上限?
会,而且是刻意的。能力矩阵里每一项都标了状态:飞书/Lark 的消息、多维表格、文档与知识库、任务日历是 stable;Google SSO 登录是 limited(可能被机器人检测拦住);微信系与依赖设备指纹的应用是 unsupported。取不到的字段留空并说明,不做估算填补——我们认为一个会如实说"做不到"的员工,比一个什么都答应的助手更可用。
个人 agent 和数字员工平台能并存吗?
能,而且这是最常见的组合。工程团队用个人编程 agent 写代码;全公司用数字员工处理跨系统的重复劳动。判断口诀:这件事需要一个懂技术的人在旁边看着吗? 需要 → 个人 agent;不需要且希望它每天自己跑 → 数字员工。
迁移成本有多高?
知识与规则可以导入,真正要重做的是"谁在什么条件下该做什么"这类流程逻辑——因为企业形态用的是岗位分工而不是个人配置。建议用试用期(7 天全功能,5 席 + 300 万 token)跑一个你现在真的每天在人工做的活,而不是跑演示场景。平台今天真正跑得稳的能力,逐项列在能力清单。
怎么衡量转过去之后有没有效果?
按场景比对,别看总量。可核对的口径举例:全站技术 SEO 审计(122 页 × 29 条规则)人工逐页检查约 10 小时,系统 30 分钟且每日自动;多仓动销与补货测算人工导出建模约 4 小时/次,系统每日 07:30 无人值守。人工侧是按常规作业强度的估算,系统侧是生产环境的真实配置——两者不混算。