AI 编程与 Vibe Coding
开发任务高频,结果能通过运行和测试验收;模型已经从代码补全扩展到修改文件、运行、测试和部署。在持续增长的产品池里,AI 编程产品占比较大。
这张地图按产品所处阶段观察市场:哪些已经成熟,哪些还在增长,哪些刚刚冒头,哪些已经退出或被平台吸收。
有稳定市场位置、较大用户或收入规模,产品价值已经被持续使用验证。
近期出现明确的用户、收入、排名或组织采用信号,但市场位置仍在变化。
概念和产品切口值得关注,但用户规模、付费和持续使用大多还没有得到验证。
包括产品关闭、静默下线、被大型平台吸收、团队收购后关产品和经营失败。
开发任务高频,结果能通过运行和测试验收;模型已经从代码补全扩展到修改文件、运行、测试和部署。在持续增长的产品池里,AI 编程产品占比较大。
法律、客服、医疗和招聘的任务价值高、流程相对明确,企业有预算为效率和产能付费;高证据案例已经出现收入或组织采用。
邮件、会议和资料处理每天都会发生;产品直接进入邮箱、会议和企业知识库,天然拿到上下文,用户不必反复复制材料。
Agent 从演示进入长期运行后,身份、记忆、轨迹、成本、审批和故障恢复会成为配套需求;目前只是多个早期产品重复出现,市场规模尚未验证。
视频和语音模型降低了内容生产门槛,企业又持续需要营销视频、配音和会议记录;进入视频制作、开会和佩戴耳机等已有行为,比创造全新使用习惯更容易。
这里说的失败包括商业关闭、无法规模化和失去独立产品位置。被平台吸收不一定说明能力无用,它通常说明产品位置没有成立。
产品可以很好用,但如果用户只是偶尔使用,或者愿意长期使用的人太少,仍然无法支撑独立业务。
这里失败的不是能力,而是独立产品位置。
客户可能认为产品有价值,但公司每增加一个客户都要重新投入大量人力,业务就很难复制。
产品能够交付,不等于交付方式能够形成健康业务。
常见问题包括:Agent 执行到一半失败;不知道任务是否真正完成;操作错误后无法撤回;关键动作缺少确认;用户仍要检查和重做大部分结果。
这类产品演示效果往往不错,但进入生产环境后,错误成本会迅速放大。
这类产品不是完全没有价值,而是用户和产业为获得价值付出的改造成本太高。
从 1,000 个 AI-native 新品、900 个补充发现样本和 94 个 B/D 核验案例, 拆解今天什么在增长、用户为什么愿意持续使用,以及产品为何失去独立位置。
这批样本反映的不是“AI 还可以生成什么”,而是产品竞争已经后移: 谁能进入真实工作流、拿到上下文、完成任务、让结果可验收,谁才更可能从 C 走向 B。
B 组 202 个产品中,开发与软件生产占 104 个。构建工具已经拥挤,安全、维护、恢复、评估和 AgentOps 正成为下一层缺口。
持续使用来自三种动力:省掉高成本劳动、跨过专业门槛、把高价值任务更快做完。单纯“更聪明”不足以形成复访。
D 组最典型的失败不是功能完全不可用,而是低频、缺少持续需求、无需独立入口,或交付结构无法规模化。
下一阶段的 AI 产品,不应再以“模型能做什么”为起点,而应以 “用户有哪个持续任务、产品能接管到哪一步、结果如何验收、使用后沉淀什么资产”为起点。
两份数据互相补充,但不能直接相加。第一份更像“广泛发现 + B/D 证据核验”, 第二份完成了 1,000 个新品的互斥分组,并用深研案例解释边界。
来自持续维护的 AI 产品仓库,覆盖面广,适合发现赛道;其中另有 B 组 46 个增长核验案例、D 组 48 个退出案例。
限制 目录收录不等于增长,自动推断的用户类型和入口只能用于启发。
综合 Product Hunt 430、Hacker News 210、YC 180、GitHub 180 个结构化新品样本,形成 A29 / B202 / C767 / D2,并另附 142 个深研案例。
限制 B 全量中部分依据是发布动量,强度低于 B 深研的收入、用户与机构采用证据。
两份表都纳入的增长案例,包括 Codex、Lovable、Emergent、Base44、Manus、Decagon、Fyxer 等。
第一份多 20 个成熟/全球标杆,第二份多 7 个中国市场或新近 Agent 案例,反映研究边界不同。
两份表的历史退出深研库完全重合,因此失败机制按 48 个唯一案例统计,不重复计数。
B 组说明什么已经获得增长,C 组说明什么值得提前观察。两者放在一起看, 最明显的迁移是:构建能力继续爆发,但价值开始向任务交付、运行维护和现实世界闭环后移。
B 组 202 个产品里,开发与软件生产占 104 个,是第二大品类的 4.5 倍。 头部产品不再只生成代码,而是把需求、编辑、运行、部署和协作串成完整体验。
增长较强的 Agent 都在接管具体任务:客服解决、法律工作、邮件处理、招聘交易、企业知识行动。 C 组则开始补身份、记忆、恢复、轨迹、安全等生产化能力。
法律、医疗、客服、招聘等场景共同点是:单次任务价值高、流程明确、结果可验收, 允许产品用专业规则、案例和反馈构建非模型壁垒。
用户不愿为每个能力再开一个 App。B 组的 Fyxer、Notion AI、Glean 借既有工作流获得上下文; C 组的 Poke、ClarifierAI、MultiChat 则直接尝试消息与系统输入层。
视频、音频、演示等产品仍有显著增长,尤其是把专业制作门槛压缩到普通用户可用。 但只提供单点生成的产品很难长期占住入口,模板、品牌规则、发布和分发闭环更重要。
C 组的边缘创新集中暴露了下一阶段需求:Agent 需要独立邮箱与身份,需要跨模型记忆, 需要长周期托管、轨迹观测、成本控制、故障恢复和安全隔离。
viaim 把会议记录与耳机这一成熟入口结合;Open Wearables API 试图统一跨设备数据; OASIS Ring 用硬件增强输入。相反,替代手机、持续录音等新行为承担更高教育和信任成本。
“好用”不是界面顺滑或模型回答漂亮,而是用户在真实任务中感到: 这件事现在更省力、更快、更确定,而且下一次还值得回来。
用户不是追求“体验 AI”,而是想少写代码、少整理邮件、少录 CRM、少做会议纪要。
不会编程也能做应用,不会剪辑也能做视频,不熟法律材料也能进入专业流程。
在医疗、法律、客服、招聘等领域,节约的不只是时间,而是案件、响应、成交或服务产能。
当产品能记住偏好、后台执行、追踪状态并在异常时叫人回来,复访从“主动打开”变成“持续委派”。
而是完整的使用条件:明确触发时机、已有上下文、可交付结果、失败处理方式、复访理由和分发入口。 C 组常常已经看见了需求,却还没有证明“用户下周为什么回来”。
48 个历史案例中,仅 20 个被源表标为“真商业失败”,28 个属于否或不确定。 退出可能来自关闭、破产,也可能来自被平台吸收、团队收购、主动转型或后继模型替代。
产品能在某一刻解决问题,但任务触发频率低、使用周期短,单次价值又不足以支撑高客单价。 这类产品常获得“第一次很好用”的评价,却难形成周留存。
用户需要的是一次结果,而产品没有后续状态、数据和关系可以继续管理;或内容生成的新鲜感很强, 但没有稳定消费、协作、交易或分发循环。
这是 D 组最确定、也最容易被误判的一类。能力有价值,甚至团队和技术很有价值, 但它更适合成为超级助手、操作系统、浏览器、工作区或模型平台的一部分。
Demo 或试点有效,不代表交付能复制。企业集成、人工兜底、硬件供应链、医疗责任、融资节奏与获客成本, 都可能让收入增长无法转化为健康现金流。
真正可以归为“本身不好”的,不应只凭关站推断,而要看到核心体验、信任、价值或单位经济存在结构性缺陷。 48 个案例中有 14 个明确标注“证据不足”,这部分不能为了故事完整而强判产品差。
成功产品和退出产品之间,不是一条“技术先进程度”的线,而是五条产品边界。 每一条都能在立项前被验证。
① 一个可验收的垂直高价值任务;② Agent 的运行、评估、恢复与安全层; ③ Vibe Coding 生成后的监控、维护、迁移和安全;④ 嵌入邮件、消息、输入、工作区与硬件的低摩擦入口; ⑤ 跨设备、跨平台的数据与执行闭环。
本报告是对用户提供的两份 Excel 做的二次分析,不额外扩大样本宇宙。 产品数据主要来自 Product Hunt、YC、GitHub、a16z 榜单、Similarweb / Sensor Tower 聚合、 公司披露、媒体报道和官方公告。不同证据强度不可等量齐观。