警告:这些是“加入”的草稿。
可能很多下面的东西是行不通的; 我制作了这些作为给ME的操作方法, 然后做所有步骤,让样本应用起作用...你一直偷偷摸摸地看到它们!它们很可能在12月中旬就绪。
## 一. 导言 导言 导言 导言 导言 导言 一,导言 导言 导言 导言 导言 导言
系好安全带 因为这将会是很长的系列!
如果你一直跟着这个博客, 你会知道,我有点沉迷于 寻找有趣的方法 来使用LLMS和AI在实际应用中。
建立写作助理, 帮助我以现有内容作为知识库, 起草新的博客文章。
注:这是我对人工智能(协助起草)和我自己编辑的实验的一部分。
帮助以我固定风格起草新博客文章从过去的条款中建议相关内容供参考寻找类似的员额,以保持一致性
就像"你的博客的GitHub Copilot"
GPU 通用 GPU**NVIDIA RTX A4000 (16GB VRAM)**CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU
96GB - 超能力, 32GB是充裕的
**现代CPU现在包括专门的AI加速器:*英特尔核心超(Meteor湖+) - Intel AI 推动(NPU)*阿姆德·雷森·阿尔
(7040/8040系列) - XDNA NPU
AMD Ryzen AI 马克斯
模型兼容性
:仍在实验LLM推理
# Use DirectML execution provider (supports NPU)
dotnet add package Microsoft.ML.OnnxRuntime.DirectML
# In code:
var sessionOptions = new SessionOptions();
sessionOptions.AppendExecutionProvider("DML"); // DirectML
var session = new InferenceSession("model.onnx", sessionOptions);
**您可以使用 NPUs 来推断吗 ?**是,但:所需要求直接洗钱在 ONNX 运行时模型需要采用ONNX格式(而不是GGUF)
C##支持是实验性的与CUDA相比,目前业绩不佳。
今后审议
矢量数据库
Windows 客户程序
LLM 整合
引用和链接生成
自动建议内部链接和有关员额的参考资料
样式一致性引擎
GitHub Copilot(GitHub Copilot)是「GitHub Copilot在语法上相遇」,
为什么是律师GPT?
现代律师事务所利用在广大判例法图书馆接受培训的LLMs帮助起草法律文件。
编写动议时,系统:
推荐以前有效的语言模式
自动切入源自动
当我开始写"添加实体框架..."时,系统应该:找到我以前与EF有关的职位, 推荐我以前使用过的结构图案提供来自过去文章的相关代码片断
保持我的写作风格和技术深度与通用的人工智能写作助理不同, 我们的系统以过去的实际内容为基础, 所以它不会显示的东西 与我已经写的东西不符。A. 系列概览以下是我们接下来几周要覆盖的内容:).
我们会确定我们正在建造的建筑和为什么, 加上建筑决定。
为GPU加速的 AI 工作量设置窗口,安装CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA, CHUNDN CHIN CHIDDN 中, cCDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDDN 中,测试C#能够实际看到并使用您的 GPU。第三部分:了解嵌入和矢量数据库深潜到实际嵌入内容, 如何让语义搜索, 并选择正确的矢量数据库( 锅炉: 我们可能会使用)
或pgvictor 变量, 第4部分:建设吸收管道处理标记文件、智能集成策略( 你不能在段落上分割! ) , 并生成我们所有内容的嵌入 。
选择正确的框架(
瓦隆
MAIU MIU MIU MIU 中
第6部分:地方LLM整合
微调问题
你可能会想:“为什么不在所有博客文章上微调一个LLM呢?”
很难理解什么是模型"学习"
✅ Always up-to-date (just re-index new posts as you write them)
✅ Grounded in your actual writing (maintains consistency)
✅ Traceable (know which past posts influenced suggestions)
✅ Efficient (no expensive retraining for every new post)
✅ Flexible (can swap out LLMs or adjust search strategies)
✅ Privacy-preserving (everything runs locally)
-不能保证模型不会编造出来的
graph TB
A[Markdown Files] -->|Ingest| B[Chunking Service]
B -->|Text Chunks| C[Embedding Model]
C -->|Vectors| D[Vector Database]
E[User Writing] -->|Current Draft| F[Windows Client]
F -->|Embed Context| C
C -->|Query Vector| D
D -->|Similar Content| G[Context Builder]
G -->|Relevant Past Articles| H[Prompt Engineer]
H -->|Prompt + Context| I[Local LLM]
I -->|Generated Suggestions| J[Link Generator]
J -->|Suggestions + Citations| F
F -->|Display| K[Editor with Suggestions]
class C,I embedding
class D,K output
classDef embedding stroke:#333,stroke-width:4px
classDef output stroke:#333,stroke-width:4px
无法轻易追踪到来源的答案
RAG 如何解决这个问题
RAG结合了两个世界的最好因素:LLMs的力量和精确的搜索,以创造符合背景的内容生成。
流动是:
用户开始写入( 例如, “ 用 APP. NET 核心建立 REST API... ” ) )
系统在音义上发现与过去文章相似
系统将相关块块作为 LLM 的上下文输入给相关块根据过去的内容,LLM产生建议/延续
这意味着:
系统架构
让我分解我们将要建设的关键构件:
**本构成部分:**从博客目录读取标记文件
太小,你失去背景。
**太大了,你浪费了LLM的上下文窗口。**我们需要在语义上有意义的部分 -- -- 完整的思想或部分,而不是任意的段落断段。
技术选择
句式变换
(最新开放源)**3 个矢量数据库**矢量数据库存储器嵌入并能够进行快速相似搜索。**当你在写“Docker作曲”时, 它发现 K 语义上最相似的过去内容, 不仅仅是关键词匹配, 而是概念上相关的材料。**技术选择
解冻
- 另一项可靠的选择,有良好的.NET支持:
我们需要一个良好的UI 在AI帮助下写作。思考配有建议的分裂版编辑器 。 @ info: whatsthis
的跨平台潜力。5 个当地LLM整合
我们想在当地运行LLM,用于:
技术备选办法
卡拉马. cpp
非常积极的发展
用于.NET的点火引信
书面协助的迅速结构结构
:在小批次中嵌入流程
: 7B质量较高的量化(Q5/Q6)
:用于更快输送量的较大批量**也可以运行也可以运行**:约13B模型,具有侵略性量化
快速推断
客厅
发展方法
以最简单的组件( 标记读取、 块) 开始
添加嵌入生成( 在本地化之前可以先以 API 为基础开始)
启动矢量搜索工作
构建基本 UI 构建基本 UI
使用 ONNX 进行基本推断测试
技术文件 技术文件 技术文件- 保持大型医生机组的一贯风格!
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.