Back to "为什么大多数商业“AI”项目都笨笨"

This is a viewer only at the moment see the article on how this works.

To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk

This is a preview from the server running through my markdig pipeline

AI LLM Opinion Software Development

为什么大多数商业“AI”项目都笨笨

Wednesday, 26 November 2025

"我们正在建立一个人工智能知识助理 它将革命我们的员工如何获取信息..."

  • 2024-2025年的每一份招聘广告、投球甲板和咨询提案

一. 导言 导言 导言 导言 导言 导言 一,导言 导言 导言 导言 导言 导言

我在过去一个月左右的时间里 沉浸在商业人工智能空间中。 阅读了大量的市场营销广告。 花了很多工作广告。 参加比我想承认的更多的产品演示。 我得出了一个相当令人沮丧的结论。

几乎都是一样的事

“企业知识的智能文件搜索” “企业知识的Customer chatbot ” 删掉无气的营销拷贝, 你会发现同样的结构,同样的失败模式, 和同样令人失望的利益攸关方, 大约6个月后。

顾客聊天机变体特别令人愉快 — — 当那些不理解卫兵的开发商在公众面前放纵他们时,这些变体会很快成为公关灾难。 没有什么能比得上你的支持机器人在提供你没有给予的退款、制造不存在的产品特征、或者在有人问起航运时间时对存在的意义进行哲学上的切入。 没有适当的限制,这些机器人将乐于承诺任何事,承认你们公司没有犯罪,或者对竞争者形成强烈的看法。 典型的例子仍然是Air Canada的聊天机充满信心地发明了一种不存在的沉睡政策 — — 而公司却被法庭扣押。

这是管理层没人想听到的肮脏秘密: 大部分商业人工智能项目都不是创新的, 它们都是商品管道,有高档标签。

在我更进一步之前,一个免责声明:我不是一个“AI有远见”或任何目前这种杂乱无章的标题(多数是那些方便地牵线搭桥的“铁链愿景家 ” ) 。 我是一个软件工程师,在近30年的时间里一直在建设这些系统 — — 搜索、知识管理、自然语言处理、决策支持 — — 近30年。我以前曾看到过这幅图片,有专家系统,有语义网络,有大数据。技术变化;过于有希望和交付不足的模式没有。

两类商业AI项目

解开营销的胡言乱语 你会发现95%的商业“AI”项目 属于两类之一:

类型 1: RAG 管道

这是迄今为止最常见的。 每一个“ 企业AI解决方案”都遵循这种模式:

flowchart LR
    A[Documents] --> B[Document Ingestion Pipeline]
    B --> C[Vector Database / RAG]
    C --> D[Construct Prompts]
    D --> E[LLM API Call]
    E --> F[Hybrid Search]
    F --> G[Response to User]

    style B stroke:#ff0000,stroke-width:4px

那个红色盒子?

听上去令人印象深刻: “我们建立了一个能理解你们公司文件并能明智地回答问题的AI!”

现实:你建造了一个搜索引擎, 增加了步骤, 每月1万英镑的公开AI账单。

类型 2: 微调模型

"我们专门为你的行业 训练了自己的人工智能模型!"

现实:你采用了别人的模型, 把它微调到一个数据集上, 这个数据集可能太小,太脏,太窄, 无法在使用基础模型的同时, 以良好的提示来做出有意义的改变。

flowchart TD
    A[Existing LLM] --> B[Collect Training Data]
    B --> C[Clean Data - Maybe]
    C --> D[Fine-tune Model]
    D --> E[Deploy Model]
    E --> F[Discover it's not much better than base model]
    F --> G[Keep paying for inference anyway]
    G --> H[Hope nobody notices]

我所看到的大多数微调项目 最好用同样的钱 来改进他们的快感和检索系统

为什么文件摄取是梦死的地方

让我们来谈谈RAG图表中的红色盒子 最经常失灵的部分是文件摄入和它的部分 得到最少的注意 在闪光演示。

以下是销售演示所显示的:

  • 美丽的PDF 流进系统
  • 清洁标记完美提取
  • 你所有的知识, 由AI搜索!

以下是实际发生的情况:

PDF PDF 问题

PDFs是一场噩梦。它们设计用于印刷,而不是提取结构数据。我使用的每个PDF采集器都有不同的故障模式:

  • 错误合并的列
  • 成为胡言乱语的表格
  • 污染内容的页眉和页脚
  • 需要OCR(和OCR有自己的误差率)的扫描文档
  • 根本无法处理的安全保护文件
  • 将文本变成垃圾的字体编码问题

那只是PDFs 等你打中

  • PowerPoint 带有智能艺术文本的 PowerPoint 文件
  • 有音轨更改的单词文档
  • 具有合并单元格的 Excel 文件
  • 用笔迹扫描的图像
  • 90年代死亡的系统遗留格式

震动灾难

一旦您提取了文本( 简便的) , 您就需要在矢量数据库中将其块块。 这是更多神奇思维发生的地方 。

"我们会用语义拼凑!" 太好了,你的200页合同现在是500块, AI不知道哪些是相关的,哪些是按什么顺序出现的。

"我们将使用固定大小的重叠块!" 完美,你刚刚把一个句子一分为二, 而嵌入现在是无稽之谈。

flowchart TD
    A[Original Document] --> B[Chunk 1: This contract shall be governed by]
    A --> C[Chunk 2: the laws of the State of California]
    B --> D[Embedding: Legal stuff?]
    C --> E[Embedding: Geography?]
    D --> F[User asks about jurisdiction]
    E --> F
    F --> G[AI: Based on my knowledge, possibly California, or maybe legal governance, who knows]

元元元流流

良好的RAG需要良好的元数据。 但从文档中提取元数据很难:

  • 文件日期是什么? 是创建日期、修改日期还是内容中提到的日期?
  • 创建档案的人、法律作者或主题事项专家?
  • 它属于哪个类别? 您的分类学可能与文件的实际组织方式不匹配 。
  • 这份文件仍然有效吗? 还是被你系统不知道的 更新的文件取代了?

大多数组织有数十年的文件 与不一致的命名惯例, 文件夹结构 使某人有意义 谁离开2003年 和元数据 缺失或错误。

圣灵迷魂曲

让我说清楚:微调有它的位置。 但大多数公司对待微调的方式根本被打破了。

数据问题

微调需要高质量的培训数据 大多数公司都没有

  • 分散于各系统的吵闹、不一致的数据
  • 反映工作如何进行,而不是应如何进行的数据
  • 数据中充满了错误 从来没有人试图修正过
  • 数据是专有的,但实际上没有那么值钱

“我们会微调我们的支持票!”你的支持票满满都是沮丧的顾客, 低级员工提供的不正确信息, 以及不代表正常使用的边缘案例。

"我们将微调我们的销售电话!" 你是说那些销售人员承诺 产品不能遵守的?

评价问题

你怎么知道你的微调模型是否更好呢?

  • 他们没有一个好基准数据集
  • 他们没有明确的评估指标
  • 他们没有进行严格的A/B测试
  • 他们比较的是气氛,不是数据

我见过公司花了六个月时间 微调模型 然后没有办法证明它比使用GPT -4 系统灵敏的GPT -4更好

赡养问题

微调模型需要更新。 您的业务变化。 您的产品变化。 您的流程变化。 您在一月份微调的模型 正在根据过时的信息给出答案 。

但更新意味着:

  • 收集新的培训数据
  • 正在再次接受培训
  • 验证新模式
  • 部署它
  • 希望你没有引入倒退

大部分公司都一时微调一次,然后就随漂移而生活。模型慢慢变得不那么重要,而每个人都假装它还在增加价值。

什么是"AI"项目实际上很好

别误会,有合法使用的案例:

flowchart TD
    subgraph RAGWorks["✅ RAG Works When"]
        R1[Well-structured docs]
        R2[Clear metadata]
        R3[Search + synthesis use case]
        R4[Heavy ingestion investment]
        R5[Feedback loops exist]
    end

    subgraph FTWorks["✅ Fine-Tuning Works When"]
        F1[Large high-quality dataset]
        F2[Base model truly struggles]
        F3[Ongoing maintenance budget]
        F4[Clear eval metrics]
        F5[Already tried prompting + RAG]
    end

    style R4 stroke:#00aa00,stroke-width:2px
    style F5 stroke:#00aa00,stroke-width:2px

绿箱是大多数项目跳过的先决条件。 "我们已经优化的促销和RAG" 是微调的栏。 "超重摄取投资" 是RAG的酒吧 跳过这些 你就在沙子上建起

真正的问题谁也解决不了

虽然每个人都在建造同样的RAG管道, 但商业人工智能中真正有趣的问题却被忽视:

数据质量

对AI有效性的最大限制不是模型,而是数据。大多数组织有:

  • 数据散布于几十个系统 彼此互不交谈
  • 没有任何真相来源
  • 数据治理比现实更加渴望
  • 任何人都没有预算可解决的质量问题

但“数据质量倡议”并没有像“AI转型”这样的福布斯文章。

进程一体化

将人工智能聊天机丢进一个现有的过程并不能神奇地使它变得更好。 这一过程需要围绕人工智能的能力和局限性重新设计。 大部分公司只是将人工智能插进中断的过程,并想知道为什么它没有帮助。

人-艾合作

最好的人工智能实施会增强人的能力,而不是试图取代他们。但是这比“自动X的AI”更难销售。

人类+人工智能合作要求:

  • 清除交接点
  • 透明AI 推理
  • 易易操作机制
  • 改进反馈循环

多数商业人工智能项目将人类视为事后考虑。

真正的创新

真正有价值的人工智能应用不是"你的文档上的聊天室"

  • 启用以前不可能的东西
  • 创建值的新类别
  • 以全新的方式解决问题

但这些是硬的。RAG管道很容易(好,容易),所以每个人都建了这样的管道。

咨询工业综合体

咨询生态系统是愚蠢的人工智能项目的一个重要驱动力:

flowchart TD
    A[Big Consultancy Tells C-Suite: You Need AI!] --> B[C-Suite Panics]
    B --> C[Consultancy Deploys Army of Juniors]
    C --> D[Recommendations: RAG + Fine-Tuning]
    D --> E[Build Same Thing as Last 20 Clients]
    E --> F[Demo Goes Well]
    F --> G[Reality: Real Data Breaks Everything]
    G --> H[Consultancy Moves On]
    H --> I[Internal Team Struggles]
    I --> J[Project Quietly Fails]
    J --> K[Nobody Admits It]
    K --> A

    style G stroke:#ff0000,stroke-width:3px
    style J stroke:#ff0000,stroke-width:3px
我见过很多次这样的模式。顾问会得到报酬。执行官会说他们做了人工智能。工程师们不得不坚持维持一些几乎无法奏效的东西。而实际的商业问题仍然没有解决。

VC - 驱动的 AI 要求

创业会陷入一个略有不同的陷阱。它不是顾问推动功能失调,而是资金环境。

timeline
    title Technology Requirements for VC Funding
    2005 : Web 2.0 - "You need social features"
    2010 : Mobile - "You need an app"
    2015 : Cloud - "You need to be cloud-native"
    2018 : Blockchain - "You need a token"
    2023 : AI - "You need an AI strategy"

听起来熟悉? 每隔几年, VC 就会决定一种新技术是必需的。 如果您的投手甲板没有突出提到它, 您没有得到资助。 技术可能与您的实际产品无关, 并不重要。 您需要这词 。

2017-2018年,我亲眼目睹了这一幕的发生。 在2017-2018年,那些没有企业的连锁公司被打入了他们的产品中,因为这正是获得资金的原因。这些连锁公司的大部分特征在资金得到保证后就悄悄消失了。

现在它发生与AI。

创业者正在将LLM功能 固定在不需要的产品上 因为:

  • 投资者不会看甲板,
  • “AI公司”的估价值高出3-5x
  • 媒体只报导AI报导
  • “AI动力”是促销的赌注

结果? 具有用户忽略的尴尬的人工智能产品的产品;在微调试验上毫无用处的跑道被烧毁;当简单的数据库查询效果更好时,工程时间浪费在RAG系统上。

最坏的部分是: 许多创始人知道这很愚蠢。他们正在建立他们不相信的人工智能功能, 因为他们需要生存足够长的时间来建立他们真正关心的东西。有些在这场比赛中成功。 大多没有。

如果你是一个启动创始人 被催促加入AI, 问问你自己:

  • 大赦国际是否真正改善了我产品的核心价值?
  • 还是我只是在为投资者检查一个盒子?

如果是后者, 建立最小可行的 AI 功能, 键入框, 然后聚焦于真正重要的东西。 不要让融资环境 分散你对建设有价值的东西的注意力 。

Hype工业综合体

以下是大赦国际里没有人想讨论的 令人不舒服的真相: 生态系统中几乎每个人都有经济刺激 来维持这群人的生活

flowchart TD
    subgraph Researchers["🔬 Frontier Labs"]
        R1[Need billions for compute]
        R2[Must show progress to justify spend]
        R3[Hype generates investment]
    end

    subgraph Companies["🏢 Tech Companies"]
        C1[Need AI angle for valuation]
        C2[Must justify AI team costs]
        C3[Hype drives stock price]
    end

    subgraph Investors["💰 Financial Backers"]
        I1[Massive capital deployed]
        I2[Need exits and returns]
        I3[Hype maintains valuations]
    end

    subgraph Media["📰 Tech Media"]
        M1[AI stories get clicks]
        M2[Access depends on positive coverage]
        M3[Hype drives engagement]
    end

    R3 --> I1
    C3 --> I1
    I3 --> R1
    I3 --> C1
    M3 --> R3
    M3 --> C3

研究人员 在边境实验室,需要数十亿的计算来培训下一代模型。 这笔钱来自投资者和大科技。 为了证明这笔支出的合理性,他们需要展示进步 — — 而“进步 ” ( progress)被转化为关于实际应用中可能实现或可能无法实现的能力的无气的公告。 如果这支巨头死亡,资金就会枯竭。

公司 (人工智能实验室和所有使用人工智能的人) 需要继续叙述。 开放性人工智能的估价取决于是否相信AGI就在转角上。 每一个“ 人工智能驱动”的启动组合都取决于AI能否保持热门部分。 当情绪发生转变时,数十亿纸质财富蒸发。

投资者 他们需要退出。他们需要音乐来持续播放足够长的时间才能实现回报。 对近期的人工智能能力进行现实的评估会在整个行业中引发评估。

媒体 媒体 AI公司发现,AI公司的故事引发了大规模的参与。 Nuanced公司的报道不会被点击。 “AI将接受你的工作 ” 和“AI突破解决了X ” 。 AI公司进入AI公司往往取决于保持积极的关系 — — 这意味着关键的报道是职业限制。

结果?一个自我强化的杂交循环, 每个人都有理由 保持膨胀的期望, 很少有人从说实话中受益。

这并不意味着AI并不真正有用——正如我在文章中所讨论的那样,这绝对是。但是,承诺与交付之间的差距是巨大的,激励机制都是为了掩盖这一差距。

当有人告诉你AI会改变你的生意时, 问问你自己:他们从你相信这件事中得到什么好处?

你实际上应该做什么?

如果你正在考虑一个AI项目, 这是我的忠告:

1. 从问题开始,而不是从技术开始

不要问“我们如何使用人工智能?” 问“我们试图解决什么问题?” 如果人工智能是正确的解决办法,那么很好。但常常不是。

2. 首先确定您的数据

在建立RAG管道之前, 修复您的文档烂摊子 。 在您微调之前, 清理您的训练数据 。 AI 无法解决您的数据问题, 它会放大它们 。

3. 启动小型和循环型

不要启动大规模的“ AI 转换 ” 。 建立一个概念的小型证明。 与真正的用户测试它, 学习实际有效的东西, 然后扩展 。

4. 投资于波音位位投资

文件输入管道不性感。 数据清理并不令人兴奋。 评估框架不是你可以向董事会演示的。 但这些都是决定成败的因素。

5. 诚实对待限制

现在的LLLM幻觉。RAG系统缺少相关文件。 精确的模型漂移。 设定现实的期望 。

6. 维护计划

建立这个系统可能占全部努力的30%。维持它,改进它,并保持其相关性是另外的70%。相应的预算。

7. 考虑一下你是否需要所有自定义解决方案

也许你需要的只是更好地使用现成的工具。 使用一些定制指令的聊天GPT也许就够了。 不是每件事都需要一个简单的AI平台。

但他们用不着笨笨

没错,我花了几个字来拖住商业人工智能项目。 如果你明智地对待这些项目,这些项目实际上可以发挥作用。

问题不是作为概念的RAG或微调。 问题在于执行懒惰、不现实的期望和忽视基本原理。 下面是如何做得更好。

Hook AI 加入现有工作流程, 不要替换他们

我认为最大的错误是将AI视为现有流程的替代,而不是强化。 您的企业已经拥有了有效的工作流程(主要是 ) 。 与其用“AI 驱动” 的版本来取代这些流程,倒不如将AI连接到空白中。

flowchart TD
    subgraph Traditional["Traditional Workflow"]
        A[Document Arrives] --> B[Human Reviews]
        B --> C[Decision Made]
        C --> D[Action Taken]
        D --> E[Results Logged]
    end

    subgraph Enhanced["AI-Enhanced Workflow"]
        A2[Document Arrives] --> AI1[AI: Extract Key Info]
        AI1 --> B2[Human Reviews - With AI Summary]
        B2 --> AI2[AI: Suggest Decision Based on History]
        AI2 --> C2[Human Makes Final Decision]
        C2 --> D2[Action Taken]
        D2 --> AI3[AI: Auto-categorise & Log]
        AI3 --> E2[Results Available for Future AI Training]
    end

注意什么是不同的:

  • 人类仍在循环中 所涉事项的决定的决定
  • AI 处理乏味部分 - 提取、总结、分类
  • 每个AI步骤都是小的和可核查的 - 如果人工智能提取错误, 人类在审查中捕捉到它
  • 存在反馈循环 - 记录结果,培训今后对AI的改进

这比"AI处理一切,有时是人类的检查" 更强大多了

使用当地LLM项目进行成本和保密

这是一个肮脏的秘密:你可能不需要 GPT-4 或 Claude 来完成大部分任务。你绝对不需要把你的机密文件发送到 OpenAI 的服务器上。

成本问题

在规模上, API 成本加起来很快。 一个忙碌的RAG 系统每天可能会发出数千个LLM 电话。 每1K 象征性的$ 0. 1- 0.0 3, 这才是真正的钱。 而随着你规模的扩大, 情况会更糟 。

保密问题

许多组织不能(或不应该)将文件寄至外部API:

  • 载有客户信息的法律文件
  • 医疗记录
  • 财务数据
  • 所有权研究
    • 国内生产总值、HIPAA等涵盖的任何事项。

解决办法:当地模式

现代的开放源码模型是血腥的好。 本地运行意味着 :

  • 每个查询零边边边费 - 你付了硬件费 推断是免费的
  • 完整数据隐私 - 没有什么能留下你的基础设施
  • 无利率限额 - 使你的硬件允许的大小大小
  • 自定义选项 - 微调,不离开数据控制
flowchart LR
    subgraph Cloud["Cloud API Approach"]
        A1[Your Documents] --> B1[Internet]
        B1 --> C1[OpenAI/Anthropic]
        C1 --> D1[£££/month]
        C1 --> E1[Privacy Concerns]
    end

    subgraph Local["Local LLM Approach"]
        A2[Your Documents] --> B2[Your Server]
        B2 --> C2[Local LLM]
        C2 --> D2[Fixed Hardware Cost]
        C2 --> E2[Data Never Leaves]
    end

当地实用实用示范备选方案

用于 嵌入 (RAG矢量搜索位) :

  • 句式变换 - 快速,准确,用微量硬件运行
  • 混血 - 质量高,足迹小
  • BGE 模型 - 与商业选择竞争

用于 代 代 代 (实际“AI”答复):

  • Llama 3.1 8B/70B - 极具一般目的,指导如下:
  • Mistral/ Mixtral 米斯特拉/ 混合 - 快速、高效、合理推理
  • Phi-3 - 其大小令人惊讶的惊人能力
  • 25人 2.5人 - 强有力的多语文支持

用于 编码任务:

  • 代码Llama - 守则专门培训
  • 深SeepSeek 编码器 - 极好的代码理解
  • 星级 Coder - 有利于多种语言

在本地运行这些没有你想的那么难 奥拉马, 卡拉马. cpp, vLLLM vLLLM 电算器,或 文本代代-推定 直截了当。我建了许多应用程序(见文章底部), 展示了消费者硬件的运行情况。

混合方法

你不必一无所有或一无所有 一个明智的建筑使用:

  1. 高容量、低复杂度任务的地方模型

    • 文件分类分类
    • 实体开采
    • 简单 A
      1. 摘要概述
  2. 需要时用于复杂推理的云道动宣传广告

    • 复杂多步骤分析
    • 需要最大上下文窗口的任务
    • 当地模型信心低时后退

这种混合方法在真正需要云模型时,会给您带来当地推论的成本效益。

构建递增值, 不是大爆炸转换

flowchart LR
    subgraph Waterfall["❌ The Waterfall AI Project"]
        W1[Month 1-3: Requirements] --> W2[Month 4-6: Build Platform]
        W2 --> W3[Month 7-9: Integration]
        W3 --> W4[Month 10: Demo - Looks Great!]
        W4 --> W5[Month 11: Real Users Break It]
        W5 --> W6[Month 12: Project Shelved]
    end

    subgraph Incremental["✅ The Incremental Approach"]
        I1[Week 1-2: One Small Problem] --> I2[Week 3-4: Refine + Measure]
        I2 --> I3[Week 5-6: Add Capability]
        I3 --> I4[Week 7-8: Refine + Measure]
        I4 --> I5[Repeat...]
        I5 --> I6[Continuous Value Delivery]
    end

    style W5 stroke:#ff0000,stroke-width:3px
    style W6 stroke:#ff0000,stroke-width:3px
    style I6 stroke:#00aa00,stroke-width:3px

渐进式方法中的每一步都会带来可衡量的价值。 每一步都会教给你一些东西。 如果某件事失败了,你就会损失几周,而不是几个月。

使文件摄取成为首类关注

记得图中的红色盒子吗?

投资质量超过数量。 从你最重要的文件开始, 并纠正错误。

使用AI帮助摄入。 现代视觉语言模型(GPT-4V、Claude、LLALVA,当地)实际上能够以传统OCR所不能的方式阅读复杂的文件 -- -- 表格、图表、手写笔记 -- -- 。

建立反馈循环。 当检索失败时, 请登录它 。 当用户说“ 文档不是这么说的 ” 时, 请捕捉它 。 使用此反馈来改善您的摄入管道 。

承认有些文件没用 并不是每个古代扫描的PDF都值得与它战斗。 有时答案是“我们将手动处理这种类型 ” , 而不是花几个月的时间处理悬崖案件。

思考整个系统,而不仅仅是 AI Bit

可行的全局性解决办法需要:

大部分项目都做什么? 实际有什么用? |-----------|----------------------|---------------------| ? 数据摄入? ? ? ?

  • 数据质量 * * "AI会弄清楚的" * 专用清洁管道 * * 获取 基本矢量搜索 混合搜索 + 重新排序

人文审查 任选 融入工作流程 继续改进循环 \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \ \
监控"有效" 详细度量和警示 定期更新及再培训

人工智能模式可能是一个工作系统的20%。其他80%是使其在生产中发挥作用的无聊的东西。

构建从第一天开始的可观测性

你无法改进你无法测量的东西 每个人工智能系统都应该追踪

  • 检索获取质量:您是否找到相关文件?跟踪检索精确和回溯。
  • 生产质量:答复是否准确?跟踪幻觉率(是的,这是困难的)。
  • 用户用户满意度:人们真的觉得它有用吗?跟踪使用率,完成率,拇指上下。
  • 每个查询费用:你实际花费了多少?跟踪象征性使用、延时、基础设施成本。
  • 故障模式:它何时断开?按文档类型、查询类型等跟踪错误率。

这个数据可以告诉你投资的努力在哪里。 也许你的检索是伟大的, 但一代是幻觉。 也许某些文档类型总是失败。 您无法修复您看不到的东西 。

"大LLM解决一切的结束"

这是目前最重要的转变: "在GPT -4扔下一切,希望最好"的时代即将结束。

2023-2024年的方法很简单: 得到你能够买得起的最大模型, 把上下文窗口装满了一切, 并祈祷。 它起作用了... 类似。 对于演示, 对于原型, 对于获得投资。

但它不缩放,它很昂贵,很慢,越来越聪明的建筑比它更出色。

转向管束式小型模型

未来不是一个无所事事的巨型模型 多个专业模型共同合作每个人都在做它擅长的事

flowchart TD
    subgraph OldWay["The 2023 Approach"]
        A1[Everything] --> B1[GPT-4]
        B1 --> C1[Hope It Works]
        B1 --> D1[£££££]
    end

    subgraph NewWay["The 2025+ Approach"]
        A2[Input] --> B2[Router Model - Small/Fast]
        B2 --> C2[Specialist Model A - Extraction]
        B2 --> D2[Specialist Model B - Reasoning]
        B2 --> E2[Specialist Model C - Generation]
        C2 --> F2[Orchestrator]
        D2 --> F2
        E2 --> F2
        F2 --> G2[Output]
    end

这是我一直在探索的 DiSE(稀释合成合成进化) 工作—— 认为 结构比对亮度由小型、重点突出的模型组成的精心策划的管道,优于试图做一切事情的单一大规模模型。

同样的思维也适用于 合成决策引擎 概念: 使用多个LLM 后端序列, 每个模型都带来不同的强项。 快速的分类模型、 准确的验证模型、 创造性的一代模型。 每个人做自己最擅长的事 。

为何此事对RAG很重要

如果你还没有,看看我的 RAG系列 它深入地植根于基本原理。但以下是关键的观点: RAG本身是这种精心策划的方法的一种形式。您正在使用嵌入式(一个模型)来查找相关内容,然后使用一个LLM(另一个模型)来合成一个答案。

下一个演进将进一步推进这一点:

  • 嵌入模型 找到候选文件
  • 重新排序模式 按实际关联性分列的订单
  • 分类分类模式 确定查询意向
  • 小农模式 处理简单的事实查询
  • 大型推理模型 处理复杂的分析(仅在需要时)

每个模型都比使用GPT-4(GPT-4)的模型小,速度更快,价格也更低廉。 但两者加在一起,它们都优于单一方法。

危险未来

“试剂”一词是从心理学(我进入软件之前的最初领域)中借用的。 在心理学中,机构指的是独立行动、做出选择和在世界上执行这些选择的能力。 代理人不仅仅对刺激作出反应;他们发起行动,追求目标,并根据结果调整行为。

A. A. A. A. A. A. 这个概念适用于语言模式。 与传统模式不同——你问一个问题,这个模式产生文本——一种代理系统实际上可以 做一些事情。它可以使用工具,执行代码,查询数据库,调用 API,写入文件,并协调多步工作流程。这与要求某人提供方向和雇用人载你到那里不同。

这就是人类人类最新的模型(包括 克劳德·奥普斯4.5 我真正用来写这个 通过克劳德代码) 证明如此有效。

使微调人群感到不舒服的是: 如果你对工具描述得够清楚, 不需要花费昂贵的微调来使用工具。 现代基础模型非常擅长在盒子外使用工具——你只需要有清晰的功能图案和好的文件。

这是与工具前者方法(通过测量结果来学习何时使用工具的模型)的大规模转变。 这是昂贵的, 需要专门的培训数据, 并且将您锁定在一套特定的工具中。 选项? 清楚地描述您的工具, 给模型提供良好的背景, 并让它知道何时使用它们 。

结果往往较好,因为:

  • 工具说明可以即时更新 - 不需要再培训
  • 可在运行时添加新工具 - 再加一个假想
  • 该模型得益于其一般推理 - 不只是记忆模式
  • 您可以使用任何能用的模型 - 不是特别的细微调整
flowchart TD
    subgraph RAG["Traditional RAG Chatbot"]
        R1[User Question] --> R2[Search Documents]
        R2 --> R3[Construct Prompt]
        R3 --> R4[LLM Generates Answer]
        R4 --> R5[Return to User]
    end

    subgraph Agentic["Agentic AI Pattern"]
        A1[User Task] --> A2[LLM Understands Task]
        A2 --> A3[Break Into Steps]
        A3 --> A4{Select Tool}
        A4 --> A5[Execute Tool]
        A5 --> A6{Evaluate Results}
        A6 -->|Need More| A4
        A6 -->|Done| A7[Return to User]
    end

    style A6 stroke:#00aa00,stroke-width:3px

这种代理模式与RAG聊天室有根本的不同, 而真正的价值就在于那里。

Lang Chain、LlamaIndex和Semmantic Kernel等框架使今天成为可能。 您可在下列地点建立系统:

  • 小型快速模型处理路线和分类
  • 专门模型处理具体领域任务
  • 工具的使用使能力超越纯语言
  • 反馈回路使不断改进成为可能

找出答案的公司将建立实际有效的人工智能系统。 仍在试图微调成功途径或建设另一个RAG聊天室的公司将继续感到失望。

在哪里学习更多

我写了很多关于这些模式的文章:

你將學會什麼? |-------|--------------------------------------------------------------------------|-----------------------------------------------------------------| | 建筑结构结构 | DISE 对旅行者 为何结构化的管弦 胜过单一模式? | 多模式 | 合成决定引擎 建造专用模型的管道 | RAG 基础 | RAG系列 * 从嵌入到生产系统 * * * * * * * 从嵌入到生产系统 * * * * * * * * 从嵌入到生产系统 * * * * * * * 从嵌入到生产系统 * * * * * * * 从嵌入到生产系统 * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * | 本地嵌入器 | 使用 ONNX 搜索语义 CPU 方便本地矢量搜索 | 当地LLM 当地LLM | DiSE 日志 使用连接在一起的本地模型的Selkf evolvign工作流程系统 | APPI 模拟模拟 | LLMApi 磁石 使用当地LLMs模拟API测试 | 实用RAG | a 建造律师GPT * 完成RAG的执行工作

技术已经存在。 模式正在出现。 问题在于贵组织是建立一些明智的还是另一个愚蠢的AI项目。

结论 结论 结论 结论 结论

当前的商业AI景观让我想起早期的网络时代。 每个人都需要“网络战略 ” 。 公司建立网站是因为他们必须建立网站,而不是因为他们知道如何处理这些网站。 这些网站大多是毫无用处的。

最终,成功的公司是那些知道网络实际上什么是有用的,并且为此而建立起来的公司。 AI也会发生同样的情况。

现在,我们正在“建设它,因为我们必须”阶段。大多数项目都是愚蠢的。多数项目会失败或失败。对于新技术来说,这是正常的。

但如果你想成为成功者之一, 请停止遵循模板。 从真正的问题开始。 投资于无聊的部分。 为了上帝的爱, 在你指责LLM之前, 修复您的文件接收管道 。

人工智能不是问题,你的数据是,你的过程是,你不切实际的期望是。

先修那些,也许,也许,也许, 只是也许,你的人工智能项目 不会是愚蠢的。

logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.