为您的博客建设“律师GPT”,第一部分:介绍和建筑 (中文 (Chinese Simplified))

为您的博客建设“律师GPT”,第一部分:介绍和建筑

Wednesday, 12 November 2025

//

8 minute read

警告:这些是“加入”的草稿。

可能很多下面的东西是行不通的; 我制作了这些作为给ME的操作方法, 然后做所有步骤,让样本应用起作用...你一直偷偷摸摸地看到它们!它们很可能在12月中旬就绪。

## 一. 导言 导言 导言 导言 导言 导言 一,导言 导言 导言 导言 导言 导言

系好安全带 因为这将会是很长的系列!

如果你一直跟着这个博客, 你会知道,我有点沉迷于 寻找有趣的方法 来使用LLMS和AI在实际应用中。

建立写作助理, 帮助我以现有内容作为知识库, 起草新的博客文章。

注:这是我对人工智能(协助起草)和我自己编辑的实验的一部分。

  • 同一个声音,同样的务实;只是更快的手指。
  • 思考现代法律惯例如何利用受过判例法培训的LLMs起草案情摘要、动议和合同。
  • 它们不是从零开始的, 系统引用了相关的先例, 以成功的过去文件为基础提出语言, 并保持与既定模式的一致性。
  • 这正是我们在这里建设的,但是为了博客内容。
  • 目标是设立一个由大赦国际授权的写作助理,负责:

帮助以我固定风格起草新博客文章从过去的条款中建议相关内容供参考寻找类似的员额,以保持一致性

自动生成相关文章的内部链接

就像"你的博客的GitHub Copilot"

  • 这个系列将涵盖建造一个完整的回收增加的一代(RAG)
  • **在 Windows 上运行的 C # 系统中。**我们将使用最新的方法和框架, 我会解释每一个新技术, 当我们遇到它的时候。
  • **我的硬件设置( 和最小标准)**我的开发机器:

GPU 通用 GPU**NVIDIA RTX A4000 (16GB VRAM)**CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU CPU

AMD Ryzen 9 9950X AMD Ryzen 9 9950X AMD Ryzen 9 9950X AMD Ryzen 9 9950X

  • 内存内存96GB 复员方案5
    • 这是我的特别安排,但你
    • 不需要这个硬件
  • **紧随其后。**以下是不同部件的最小规格 :
    • GPU加速(建议,不需要)
  • 最低最低NVIDIA GPU,8GB VRAM (例如RTX 3060, GTX 1070 Ti)

可以用量化方式运行 7B 参数模型

  • 体面嵌入型发电速度舒适
  • **12GB+VRAM(例如RTX 3060 12GB,RTX 4060 Ti)**运行更大的模型或质量更高的量化
  • 我设下我的圈套
    • 16GB(A4000) - 能够舒适地运行13B模型
    • CPU- 唯一替代 CPU
    • 最低最低

:现代四极CPU

  • 建议建议8+核心(合理嵌入生成)
    • 每样东西都只用CPU,只是慢点:
  • 嵌入生成: ~ 5- 10x慢LLM 推断:~10-50x慢
    • 写作助理仍然完全可以使用!
  • 记录和记录管理所需资源最低最低

16GB 系统内存

  • 7B 型号为 7B 型号的 CPU 单CPU 推断舒适
  • 32GB:32GB更有利于大型CPU模型

我设下我的圈套

96GB - 超能力, 32GB是充裕的

  • 储存储存SSSD SSD SSSD SSSD SSSD SSSD SSSD SSSD SSSD SSSD SSSSD SSSSSSSSSSS SSSSSSSSSSSSSS SSSSS SSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSSS
  • :建议采用模型装载空间空间空间空间空间
  • : ~20GB 用于模型和矢量数据库英特尔/AMD NPUs怎么办?

**现代CPU现在包括专门的AI加速器:*英特尔核心超(Meteor湖+) - Intel AI 推动(NPU)*阿姆德·雷森·阿尔

(7040/8040系列) - XDNA NPU

  • ✅ Great for: On-device inference, battery efficiency (laptops)
  • ⚠️ Limited for our use: Immature .NET/ONNX Runtime support
  • ❌ Not ready for: This project's primary path

AMD Ryzen AI 马克斯

  1. - 最多50个有毒物质重要: NPUs 仅指推论!
  2. 你不在NPU上“建设”或训练模型运行中
  3. **培训前模式效率高。**对模型进行了关于云性GPU(或工作站)的培训,然后下载并部署到NPU进行推断。
  4. **运行 NPU 模型的当前状态( 写入时) :**为何不为这个系列提供 NPU ?
  5. 软件生态系统CUDA有15+年的成熟年限, NPU在.NET 中的支持刚刚开始。

模型兼容性

:仍在实验LLM推理

# Use DirectML execution provider (supports NPU)
dotnet add package Microsoft.ML.OnnxRuntime.DirectML

# In code:
var sessionOptions = new SessionOptions();
sessionOptions.AppendExecutionProvider("DML"); // DirectML
var session = new InferenceSession("model.onnx", sessionOptions);

**您可以使用 NPUs 来推断吗 ?**是,但:所需要求直接洗钱在 ONNX 运行时模型需要采用ONNX格式(而不是GGUF)

C##支持是实验性的与CUDA相比,目前业绩不佳。

如何尝试 NPU 推断( 高级用户) :

今后审议

  1. : 一次ONNX 运行时间
  2. 直接洗钱
  3. **NPU的成熟支持(可能为2024-2025年),**底底线
  4. **:我将展示 GPU 加速路径, 但将在整个过程中注意 CPU 唯一的替代品 。**您可以开始只使用 CPU 并稍后升级 !
  5. 我们正在建设的最后系统将包括几个组成部分:
  6. 标记下调吸收管道- 处理所有博客文章,以智能集成,并产生嵌入

矢量数据库

- 仓库嵌入并能够对类似内容进行语义搜索

Windows 客户程序

    • 编辑和建议小组的桌面写写助理UIUU,编辑和建议小组
  • LLM 整合

    • 本地GPU-加速生成内容的推推
  • 引用和链接生成

  • 自动建议内部链接和有关员额的参考资料

  • 样式一致性引擎

    • 从现有职位中学习模式,以保持声音和结构
  • GitHub Copilot(GitHub Copilot)是「GitHub Copilot在语法上相遇」,

  • 为什么是律师GPT?

  • 现代律师事务所利用在广大判例法图书馆接受培训的LLMs帮助起草法律文件。

编写动议时,系统:

参考相关先例和以往成功论据

推荐以前有效的语言模式

与法律写写写标准保持一致

自动切入源自动

这是我们的模特儿

当我开始写"添加实体框架..."时,系统应该:找到我以前与EF有关的职位, 推荐我以前使用过的结构图案提供来自过去文章的相关代码片断

与相关员额的自动生成链接

保持我的写作风格和技术深度与通用的人工智能写作助理不同, 我们的系统以过去的实际内容为基础, 所以它不会显示的东西 与我已经写的东西不符。A. 系列概览以下是我们接下来几周要覆盖的内容:).

第一部分(本职位):介绍和建筑

我们会确定我们正在建造的建筑和为什么, 加上建筑决定。

第2部分:C#中的GPU设置和CUDA CUDA

为GPU加速的 AI 工作量设置窗口,安装CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA, CHUNDN CHIN CHIDDN 中, cCDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDDN 中,测试C#能够实际看到并使用您的 GPU。第三部分:了解嵌入和矢量数据库深潜到实际嵌入内容, 如何让语义搜索, 并选择正确的矢量数据库( 锅炉: 我们可能会使用)

解冻

pgvictor 变量, 第4部分:建设吸收管道处理标记文件、智能集成策略( 你不能在段落上分割! ) , 并生成我们所有内容的嵌入 。

第5部分:视窗客户端

选择正确的框架(

WPPF WPPF

瓦隆

,或

MAIU MIU MIU MIU 中

,建立UI, 并让它真正愉快地使用。

第6部分:地方LLM整合

  1. 本地使用运行模型ONNX 运行时间
  2. 卡拉马. cpp或其它方针。
  3. **充分利用A4000!**第7部分:内容生成和即时工程
  4. **将它统合在一起对相关内容进行语义搜索、环境窗口管理、迅速进行写作援助工程设计以及提出一致的建议。**第8部分:先进地物和生产部署
  5. **自动连接相关职位, 风格一致性检查, 代码片断建议,**为什么是RAG?

在我们潜入建筑之前, 让我们来谈谈为什么RAG(RAG)是正确的方法。

微调问题

你可能会想:“为什么不在所有博客文章上微调一个LLM呢?”

  1. 成本和复杂性
    • 微调费用昂贵(计算和努力)
  2. 静态
    • 每一个新的博客文章都意味着再培训
  3. 黑盒黑盒
  • 很难理解什么是模型"学习"

  • ✅ Always up-to-date (just re-index new posts as you write them)

  • ✅ Grounded in your actual writing (maintains consistency)

  • ✅ Traceable (know which past posts influenced suggestions)

  • ✅ Efficient (no expensive retraining for every new post)

  • ✅ Flexible (can swap out LLMs or adjust search strategies)

  • ✅ Privacy-preserving (everything runs locally)

幻觉

-不能保证模型不会编造出来的

graph TB
    A[Markdown Files] -->|Ingest| B[Chunking Service]
    B -->|Text Chunks| C[Embedding Model]
    C -->|Vectors| D[Vector Database]

    E[User Writing] -->|Current Draft| F[Windows Client]
    F -->|Embed Context| C
    C -->|Query Vector| D
    D -->|Similar Content| G[Context Builder]

    G -->|Relevant Past Articles| H[Prompt Engineer]
    H -->|Prompt + Context| I[Local LLM]
    I -->|Generated Suggestions| J[Link Generator]
    J -->|Suggestions + Citations| F

    F -->|Display| K[Editor with Suggestions]

    class C,I embedding
    class D,K output

    classDef embedding stroke:#333,stroke-width:4px
    classDef output stroke:#333,stroke-width:4px

无引用

  • 无法轻易追踪到来源的答案

  • RAG 如何解决这个问题

  • RAG结合了两个世界的最好因素:LLMs的力量和精确的搜索,以创造符合背景的内容生成。

  • 流动是:

  • 用户开始写入( 例如, “ 用 APP. NET 核心建立 REST API... ” ) )

  • 系统在音义上发现与过去文章相似

系统将相关块块作为 LLM 的上下文输入给相关块根据过去的内容,LLM产生建议/延续

系统提供参考源员额的建议

这意味着:

系统架构

让我分解我们将要建设的关键构件:

    1. 目标 1. 目标
  • 标记下调吸收管道

**本构成部分:**从博客目录读取标记文件

战略问题非常重要。

太小,你失去背景。

**太大了,你浪费了LLM的上下文窗口。**我们需要在语义上有意义的部分 -- -- 完整的思想或部分,而不是任意的段落断段。

技术选择

:我们可能会使用其中之一:

句式变换

模式( 可以通过 ONNX 运行 C# 运行时间)

  • ✅ Mature, stable, lots of resources
  • ✅ Native Windows performance
  • ❌ Windows-only
  • ❌ Looks dated unless you invest in UI libraries

OpenAI的嵌入模型(通过API)

  • ✅ Cross-platform (XAML-based)
  • ✅ Modern, actively developed
  • ✅ Similar to WPF
  • ❌ Smaller ecosystem

BGE 模型

  • ✅ Cross-platform
  • ✅ Microsoft-backed
  • ❌ Still maturing
  • ❌ More mobile-focused

(最新开放源)**3 个矢量数据库**矢量数据库存储器嵌入并能够进行快速相似搜索。**当你在写“Docker作曲”时, 它发现 K 语义上最相似的过去内容, 不仅仅是关键词匹配, 而是概念上相关的材料。**技术选择

我们将评估:

解冻

    • 现代,写在Rust, 优秀的C#客户,多克友好
  • pgvictor 变量
    • PostgreSQL的扩展( 我们已经在使用 Postgres! )
  • 断断

- 另一项可靠的选择,有良好的.NET支持:

色谱

    • Python 土地最受欢迎, C区不那么受欢迎
  • 我倾向于Qdrant 因为它的简单和性能, 或者Pgvector 把所有的东西都保存在Postgres。
    1. 4个。
  • Windows 客户客户

我们需要一个良好的UI 在AI帮助下写作。思考配有建议的分裂版编辑器 。 @ info: whatsthis

  • 选项 :WPF(窗口介绍基金会))
  • 瓦隆
  • MAII(多平台App UI)
  • 既然我们以视窗为焦点,我想要稳定的东西,我正向着

WPF 与

  • 现代WPF UI
  • 瓦隆

的跨平台潜力。5 个当地LLM整合

这里是A4000GPU闪亮的地方。

我们想在当地运行LLM,用于:

  • 隐私( 没有向 APIs 发送数据)
  • 速度(当地推断速度快)
  • 费用(无API收费)
  • 控制( 我们选择模式)

技术备选办法

  • ONNX 运行时间
  • 将模型转换成 ONNX 格式
  • 优秀 GPU 加速加速度
  • C# 本地支持

下滑:并非所有模型都转换良好

卡拉马. cpp

  • 装有
  • C++ C# 绑定的 C# 库库( C++)
  • 拉马沙尔普
  • CUDA支助
  • 广泛的模型支持(Llama、Mistral等)

非常积极的发展

火炬Sharp

用于.NET的点火引信

  1. 最灵活更深的学习曲线
  2. 我正向着拉马沙尔普
  3. **其成熟和易于与流行模式一起使用。**6 . 6 . 6 .
  4. 上下文窗口管理和即时工程LLMs的上下文窗口有限(如4K、8K、32K象征性)。
  5. **我们需要:**获取最相关的过去内容( 从矢量搜索中获取上 K)

将当前草稿安装到上下文窗口中

书面协助的迅速结构结构

为所产生建议留留余地

  • 这比听上去更狡猾我们将探索各种策略,比如:
  • 基于您当前写入的内容的动态 K 选择按关联性重新排序回收的块块

智能压缩环境

使用的代码片段

- 大部分RAG的例子在Python。

- 最优化的博客写作协助,而非通用内容生成

(截至撰写本报告时的最近时间)

拉马沙尔普

  • LLM 推断

微软ML

  • - 可能用于某些任务通过ONNX转口
  • - 内嵌矢量数据库
  • 解冻
  • pgvictor 变量- 待定

UI 框架

  • WPPF WPPF
  • 现代WPF
  • 瓦隆- 现代台式UI UI

辅助工具

  • Markdig 马克式- 已经用这个进行标记分析
  • 嵌嵌入器- 用于运行 Qdrant 或其他服务
  • 实体框架核心- 如果我们使用 Pgvictor
  • GPU 堆栈CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA CUDA

12.x 12.x

  • **(截至撰写本报告时的最近时间)**CHUNDN CHIN CHIDDN 中, cCDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDN 中, CDDN 中
  • - 深深学习原始绩效考量
  • **不同的硬件装置将具有不同的能力:**8GB VRAM(最低)
  • 模型大小:7B参数模型,Q4量化

批次处理

:在小批次中嵌入流程

  1. 记忆管理管理
  2. :需要仔细监测档案和档案记录系统
  3. 井井井井井井井井有
  4. : 书写助理,嵌入生成
  5. 12GB+ VRAM(可缓解)
  6. 模型大小

: 7B质量较高的量化(Q5/Q6)

批次处理

:用于更快输送量的较大批量**也可以运行也可以运行**:约13B模型,具有侵略性量化

  • 有 16GB+ VRAM (我的设置)
  • 模型大小
  • 7B-13B参数模型
  • 批次处理
  • :全批,最低限制

快速推断

:次秒答复时间

客厅

  • :可以试验不同的模型CPU- 只有 CPU( 后退)
  • 一切都在工作,一切都在工作,只是慢一点
  • 内嵌: 5-10x慢于 GPU
  • LLM 推断: 10-50x慢于 GPU
  • 仍然可用:一个有耐心的写作助手!

发展方法

我们将逐步建立这个系统:

以最简单的组件( 标记读取、 块) 开始

添加嵌入生成( 在本地化之前可以先以 API 为基础开始)

启动矢量搜索工作

构建基本 UI 构建基本 UI

综合LLM

写入一个简单的 C# 程序以校验 GPU 访问权限

使用 ONNX 进行基本推断测试

技术文件 技术文件 技术文件- 保持大型医生机组的一贯风格!

Finding related posts...
logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.