Back to ""Lakimies GPT:n" rakentaminen blogiisi - Fine Tuning LLM Vaihtoehto: RAG Qdrantin ja Generic Online LLM:n kanssa"

This is a viewer only at the moment see the article on how this works.

To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk

This is a preview from the server running through my markdig pipeline

AI C# Cloud LLM OpenAI Qdrant RAG

"Lakimies GPT:n" rakentaminen blogiisi - Fine Tuning LLM Vaihtoehto: RAG Qdrantin ja Generic Online LLM:n kanssa

Wednesday, 12 November 2025

Johdanto

Omassa8-osainen "Lakimies GPT" -sarja, Näytin sinulle, miten voit rakentaa täydellisen paikallisen RAG-pohjaisen kirjoitusapulaisen käyttäen GPU-kiihdytintä, paikallisia LLM- ja vektoritietokantoja.

Se on voimakas, yksityinen ja toimii täysin laitteillasi.

Mutta ollaan rehellisiä - kaikilla ei ole NVIDIA GPU:ta, 96GB RAM-muistia, eikä kärsivällisyyttä luoda CUDA-, cuDNN- ja Wrangle GGUF -malleja.

Entä jos haluat vain blogin kirjoittavan avustajan edut ilman laitteistoinvestointia?

Tässä artikkelissa esitellään pilvipohjainen vaihtoehto: sama RAG-lähestymistapa, sama Qdrant-vektoritietokanta, mutta paikallisen päättelyn sijaan käytetään pilvi-LLM-rajapintoja.

Ajattele sitä "Lawyer GPT Litenä" – helpompi asettelu, matalampi sisäänpääsyn este ja mahdollisesti parempi lähtölaatu rajamalleilla.

Koko julkistus: Opin yhä, mikä lähestymistapa toimii käytännössä parhaiten, joten ota kustannusarvioni ja suoritusväitteeni ripauksella suolaa.

Voin sanoa, että pilvinen lähestymistapa on osoittautunut huomattavan suoraviivaiseksi GPU-reittiin verrattuna.

  • HUOMAUTUS: Tämä on osa kokeilujani tekoälyllä (avustettu suunnittelu) + omalla muokkauksellani.
  • Sama ääni, sama pragmatismi, vain nopeammat sormet.
  • Miksi pilvivaihtoehto?
  • Alkuperäinen lähestymistapa
  • Koko "Lawyer GPT" -sarja rakentaa järjestelmän, joka:
  • Toimii 100 % paikallisesti (yksityisyys)
  • Ei API-kustannuksia

Nopea GPU-kiihdytys

Vaatii NVIDIA GPU:ta (8GB+ VRAM)

  • Kompleksiset asetukset (CUDA, cuDNN, mallien hallinta)
  • Rajoitettu VRAMiin sopiviin malleihin
  • Ikkunakeskeinen käyttöönotto
  • Pilvivaihtoehto
  • Tämä lähestymistapa antaa sinulle:
  • GPU:ta ei tarvita (ajot millä tahansa koneella)
  • Yksinkertainen asetus (ei CUDA/cuDNN)
  • Pääsy rajamalleihin (GPT-4, Claude jne.)

Cross-platform (Windows, Mac, Linux)

Paremman tuotoksen laatu (suuremmat, kyvykkäämmät mallit) |--------------------|-------------------| API-kustannukset (vaikkakin kohtuulliset henkilökohtaiseen käyttöön) Kolmansien osapuolten rajapintoihin lähetetyt tiedot Latenssi riippuu verkosta Milloin käytetään kumpaa?

Käytä paikallista lähestymistapaa Käytä pilvipalvelua

Yksityisyys on tärkeää Kätevyydellä on eniten merkitystä

graph TB
    A[Markdown Files] -->|Ingest| B[Chunking Service]
    B -->|Text Chunks| C[Cloud Embedding API]
    C -->|Vectors| D[Qdrant Vector DB]

    E[User Writing] -->|Current Draft| F[Web/Desktop Client]
    F -->|Embed Context| C
    C -->|Query Vector| D
    D -->|Similar Content| G[Context Builder]

    G -->|Relevant Past Articles| H[Prompt Engineer]
    H -->|Prompt + Context| I[Cloud LLM API]
    I -->|Generated Suggestions| J[Response Handler]
    J -->|Suggestions + Citations| F

    F -->|Display| K[Editor with Suggestions]

    class C,I cloud
    class D,K local

    classDef cloud stroke:#f96,stroke-width:4px
    classDef local stroke:#333,stroke-width:2px

Sinulla on GPU-laitteisto Mac/Linux/kannettava tietokone

  • **Korkean volyymin käyttö Kohtuullinen käyttö (harvat virat/kuukausi)**Nautit näpertelystä. Haluat tuloksia nopeasti.text-embedding-3-smallArkkitehtuurin yleiskatsaus
  • **Pilviversio pitää samat RAG-perusasiat, mutta vaihtaa paikallisen LLM-päätelmän API-puheluihin:**Tärkeimmät erot:
  • Upotetaan malli: OpenAI's
  • API paikallisen BGE-mallin sijaanLLM

: Claude 3.5 Sonnet tai GPT-4 API paikallisen Mistralin/Llaman sijaan

GPU:ta ei tarvita

: Kaikki CPU-pohjainen paikallisesti, laskenta tapahtuu pilvipalvelussa

  • Yksinkertaisempi käyttöönotto: Yksi suoritettava, ei mallitiedostoja hallinnoitavaksi
  • **Minun pitäisi huomata, että en ole vielä tehnyt mittavia vertailuja näiden kahden lähestymistavan välillä - itse olen vielä tutkimusvaiheessa.**Ensimmäiset tulokset ovat kuitenkin riittävän lupaavia jaettaviksi.

Teknologiavarasto

  • Keskeiset puitteet.NET 9
  • - Sama kuin alkuperäisessä sarjassaC# 13
  • - Nykyajan kielipiirteetPilvirajapinnat

OpenAI API

  • **- Upotukset (tekstiin upotettavat 3-pienet) + LLM (GPT-4)**Antropistinen API
  • **- Vaihtoehtoinen LLM (Claude 3,5 Sonnet)**Molemmat

- Voit sekoittaa ja sovittaa!

  • VektoritietokantaQdrant
  • - Sama kuin alkuperäisessä, voi toimia paikallisesti Dockerin kautta tai käyttää Qdrant CloudiaVaihtoehto
  • **: Pinecone, Weaviate Cloud (hallitut vaihtoehdot)**Asiakkaan valinnat

Konsolidointisovellus

- Yksinkertaisin, hyvä testaukseen

Blazor WebAssembly

docker run -p 6333:6333 -p 6334:6334 \
    -v $(pwd)/qdrant_storage:/qdrant/storage:z \
    qdrant/qdrant

- Verkkopohjainen, toimii missä tahansa

  1. Avalonia- Cross-platform-työpöytä (Windows, Mac, Linux)
  2. Asetukset: Pikapolku
  3. 1 Täysosuma

Asenna Qdrant

Vaihtoehto A: Paikallinen asiantuntija (kehityksessä suositeltu)

**Vaihtoehto B: Qdrant Cloud (helpoin)**Ilmoittaudu osoitteessa

  1. Pilvi.qdrant.ioLuo vapaa ryhmä
  2. Hanki API-avain ja rypäs URL
  3. Ei CUDA:ta, ei cuDNN:ää, ei kuljettaja-asennuksia!

**2.**Hae API-avaimet

  1. OpenAI(siirtymien osalta + LLM):
  2. Siirry

platform.openai.com

Luo API-avainappsettings.json:

{
  "BlogRAG": {
    "Embedding": {
      "Provider": "OpenAI",
      "Model": "text-embedding-3-small",
      "ApiKey": "sk-..."
    },
    "LLM": {
      "Provider": "Anthropic",
      "Model": "claude-3-5-sonnet-20241022",
      "ApiKey": "sk-ant-..."
    },
    "VectorStore": {
      "Type": "Qdrant",
      "Url": "http://localhost:6333",
      "ApiKey": "",
      "CollectionName": "blog_embeddings"
    },
    "Ingestion": {
      "MarkdownPath": "/path/to/your/blog/Markdown",
      "ChunkSize": 500,
      "ChunkOverlap": 50
    }
  }
}

**Aseta käyttörajat (tärkeää!)**Antropistinen

(Vapaaehtoinen Claudelle):

Siirry

Consolid.anthropic.com

using OpenAI;
using OpenAI.Embeddings;

namespace BlogRAG.Services
{
    public interface IEmbeddingService
    {
        Task<float[]> GenerateEmbeddingAsync(string text);
        Task<List<float[]>> GenerateBatchEmbeddingsAsync(List<string> texts);
    }

    public class OpenAIEmbeddingService : IEmbeddingService
    {
        private readonly OpenAIClient _client;
        private readonly string _model;
        private readonly ILogger<OpenAIEmbeddingService> _logger;

        public OpenAIEmbeddingService(
            string apiKey,
            string model,
            ILogger<OpenAIEmbeddingService> logger)
        {
            _client = new OpenAIClient(apiKey);
            _model = model;
            _logger = logger;
        }

        public async Task<float[]> GenerateEmbeddingAsync(string text)
        {
            var embeddings = await GenerateBatchEmbeddingsAsync(new List<string> { text });
            return embeddings.First();
        }

        public async Task<List<float[]>> GenerateBatchEmbeddingsAsync(List<string> texts)
        {
            _logger.LogInformation("Generating embeddings for {Count} texts", texts.Count);

            var request = new EmbeddingRequest
            {
                Input = texts,
                Model = _model
            };

            var response = await _client.CreateEmbeddingAsync(request);

            return response.Data
                .OrderBy(e => e.Index)
                .Select(e => e.Embedding.ToArray())
                .ToList();
        }
    }
}

Luo API-avain

  • Asetukset
  • Luo
  • Siinä kaikki.

**Ei GPU-asetusta, ei mallilatauksia (12GB-tiedostoja), ei VRAM-hallintaa.**Täytäntöönpano

  • Peruspalvelut
  • 1 Täysosuma

Cloud Upottava palvelu

using Anthropic.SDK;
using Anthropic.SDK.Messaging;

namespace BlogRAG.Services
{
    public interface ILLMService
    {
        Task<string> GenerateCompletionAsync(
            string systemPrompt,
            string userPrompt,
            float temperature = 0.7f);

        IAsyncEnumerable<string> GenerateStreamingCompletionAsync(
            string systemPrompt,
            string userPrompt,
            float temperature = 0.7f);
    }

    public class ClaudeLLMService : ILLMService
    {
        private readonly AnthropicClient _client;
        private readonly string _model;
        private readonly ILogger<ClaudeLLMService> _logger;

        public ClaudeLLMService(
            string apiKey,
            string model,
            ILogger<ClaudeLLMService> logger)
        {
            _client = new AnthropicClient(new APIAuthentication(apiKey));
            _model = model;
            _logger = logger;
        }

        public async Task<string> GenerateCompletionAsync(
            string systemPrompt,
            string userPrompt,
            float temperature = 0.7f)
        {
            _logger.LogInformation("Generating completion with temperature {Temp}", temperature);

            var messages = new List<Message>
            {
                new Message
                {
                    Role = RoleType.User,
                    Content = userPrompt
                }
            };

            var request = new MessageRequest
            {
                Model = _model,
                MaxTokens = 2048,
                Temperature = temperature,
                System = systemPrompt,
                Messages = messages
            };

            var response = await _client.Messages.CreateAsync(request);

            return response.Content.First().Text;
        }

        public async IAsyncEnumerable<string> GenerateStreamingCompletionAsync(
            string systemPrompt,
            string userPrompt,
            float temperature = 0.7f)
        {
            var messages = new List<Message>
            {
                new Message { Role = RoleType.User, Content = userPrompt }
            };

            var request = new MessageRequest
            {
                Model = _model,
                MaxTokens = 2048,
                Temperature = temperature,
                System = systemPrompt,
                Messages = messages,
                Stream = true
            };

            await foreach (var chunk in _client.Messages.StreamAsync(request))
            {
                if (chunk.Delta?.Text != null)
                {
                    yield return chunk.Delta.Text;
                }
            }
        }
    }
}

Tärkeimmät hyödyt paikalliseen verrattuna:

  • Ei ONNX-ajoasetusta
  • Ei GPU-muistinhallintaa
  • Automaattiset erät OpenAI:n toimesta
  • Huippuluokan upotuslaatu

Kustannukset:

  • : â € 0,0001 per 1K tokens (erittäin halpa)
  • Käsittely 100 blogikirjoitusta (~500K): 0.05
  • Päivittäinen käyttö (10 kyselyä): 0.001/päivä = 0,30 dollaria kuukaudessa

Cloud LLM -palvelu

using Qdrant.Client;
using Qdrant.Client.Grpc;

namespace BlogRAG.Services
{
    public class QdrantVectorStore
    {
        private readonly QdrantClient _client;
        private readonly string _collectionName;
        private readonly ILogger<QdrantVectorStore> _logger;

        public QdrantVectorStore(
            string url,
            string apiKey,
            string collectionName,
            ILogger<QdrantVectorStore> logger)
        {
            _client = new QdrantClient(url, apiKey: apiKey);
            _collectionName = collectionName;
            _logger = logger;
        }

        public async Task CreateCollectionAsync(int vectorSize)
        {
            var collections = await _client.ListCollectionsAsync();

            if (collections.Any(c => c.Name == _collectionName))
            {
                _logger.LogInformation("Collection {Name} already exists", _collectionName);
                return;
            }

            await _client.CreateCollectionAsync(
                collectionName: _collectionName,
                vectorsConfig: new VectorParams
                {
                    Size = (ulong)vectorSize,
                    Distance = Distance.Cosine
                });

            _logger.LogInformation("Created collection {Name}", _collectionName);
        }

        public async Task UpsertAsync(
            Guid id,
            float[] vector,
            Dictionary<string, object> payload)
        {
            var point = new PointStruct
            {
                Id = id,
                Vectors = vector,
                Payload = payload
            };

            await _client.UpsertAsync(_collectionName, new[] { point });
        }

        public async Task<List<ScoredPoint>> SearchAsync(
            float[] queryVector,
            int limit = 10,
            float scoreThreshold = 0.7f)
        {
            var results = await _client.SearchAsync(
                collectionName: _collectionName,
                vector: queryVector,
                limit: (ulong)limit,
                scoreThreshold: scoreThreshold);

            return results.ToList();
        }
    }
}

**Hyödyt paikalliseen verrattuna:**Ei mallin latausta (instant startup)

Ei VRAM-raja-arvoja (käytä tarvittaessa 200K-kontekstia)

namespace BlogRAG.Services
{
    public class IngestionService
    {
        private readonly IEmbeddingService _embedder;
        private readonly QdrantVectorStore _vectorStore;
        private readonly ILogger<IngestionService> _logger;

        public IngestionService(
            IEmbeddingService embedder,
            QdrantVectorStore vectorStore,
            ILogger<IngestionService> logger)
        {
            _embedder = embedder;
            _vectorStore = vectorStore;
            _logger = logger;
        }

        public async Task IngestMarkdownFilesAsync(string markdownPath)
        {
            var files = Directory.GetFiles(markdownPath, "*.md", SearchOption.AllDirectories);
            _logger.LogInformation("Found {Count} markdown files", files.Length);

            foreach (var file in files)
            {
                await IngestFileAsync(file);
            }
        }

        private async Task IngestFileAsync(string filePath)
        {
            var content = await File.ReadAllTextAsync(filePath);
            var metadata = ExtractMetadata(content);
            var chunks = ChunkContent(content);

            _logger.LogInformation("Processing {File}: {ChunkCount} chunks",
                Path.GetFileName(filePath), chunks.Count);

            // Batch embedding generation
            var texts = chunks.Select(c => c.Text).ToList();
            var embeddings = await _embedder.GenerateBatchEmbeddingsAsync(texts);

            // Upload to Qdrant
            for (int i = 0; i < chunks.Count; i++)
            {
                var chunk = chunks[i];
                var embedding = embeddings[i];

                var payload = new Dictionary<string, object>
                {
                    ["text"] = chunk.Text,
                    ["file_path"] = filePath,
                    ["blog_post_slug"] = metadata.Slug,
                    ["blog_post_title"] = metadata.Title,
                    ["chunk_index"] = i,
                    ["category"] = metadata.Category
                };

                await _vectorStore.UpsertAsync(Guid.NewGuid(), embedding, payload);
            }

            _logger.LogInformation("Ingested {File}", Path.GetFileName(filePath));
        }

        private List<TextChunk> ChunkContent(string content, int chunkSize = 500, int overlap = 50)
        {
            // Simple sentence-aware chunking
            var sentences = content.Split(new[] { ". ", ".\n", "!\n", "?\n" },
                StringSplitOptions.RemoveEmptyEntries);

            var chunks = new List<TextChunk>();
            var currentChunk = new StringBuilder();
            var currentLength = 0;

            foreach (var sentence in sentences)
            {
                if (currentLength + sentence.Length > chunkSize && currentChunk.Length > 0)
                {
                    chunks.Add(new TextChunk { Text = currentChunk.ToString() });

                    // Overlap: keep last sentence
                    currentChunk.Clear();
                    currentLength = 0;
                }

                currentChunk.Append(sentence).Append(". ");
                currentLength += sentence.Length;
            }

            if (currentChunk.Length > 0)
            {
                chunks.Add(new TextChunk { Text = currentChunk.ToString() });
            }

            return chunks;
        }

        private BlogMetadata ExtractMetadata(string content)
        {
            // Extract from markdown frontmatter or HTML comments
            var titleMatch = Regex.Match(content, @"^#\s+(.+)$", RegexOptions.Multiline);
            var categoryMatch = Regex.Match(content, @"");

            return new BlogMetadata
            {
                Title = titleMatch.Success ? titleMatch.Groups[1].Value : "Untitled",
                Category = categoryMatch.Success ? categoryMatch.Groups[1].Value : "General",
                Slug = Path.GetFileNameWithoutExtension(content)
            };
        }
    }

    public class TextChunk
    {
        public string Text { get; set; } = string.Empty;
    }

    public class BlogMetadata
    {
        public string Title { get; set; } = string.Empty;
        public string Category { get; set; } = string.Empty;
        public string Slug { get; set; } = string.Empty;
    }
}

Parempi tuotoksen laatu (ainakin teoriassa - testaan yhä)

namespace BlogRAG.Services
{
    public class RAGGenerationService
    {
        private readonly IEmbeddingService _embedder;
        private readonly QdrantVectorStore _vectorStore;
        private readonly ILLMService _llm;
        private readonly ILogger<RAGGenerationService> _logger;

        public RAGGenerationService(
            IEmbeddingService embedder,
            QdrantVectorStore vectorStore,
            ILLMService llm,
            ILogger<RAGGenerationService> logger)
        {
            _embedder = embedder;
            _vectorStore = vectorStore;
            _llm = llm;
            _logger = logger;
        }

        public async Task<string> GenerateSuggestionAsync(
            string currentDraft,
            string requestType = "continue")
        {
            // 1. Generate embedding for current draft
            var draftEmbedding = await _embedder.GenerateEmbeddingAsync(currentDraft);

            // 2. Search for relevant past content
            var results = await _vectorStore.SearchAsync(
                queryVector: draftEmbedding,
                limit: 5,
                scoreThreshold: 0.7f);

            _logger.LogInformation("Found {Count} relevant chunks", results.Count);

            // 3. Build context from results
            var contextBuilder = new StringBuilder();
            foreach (var result in results)
            {
                var text = result.Payload["text"].ToString();
                var title = result.Payload["blog_post_title"].ToString();
                var score = result.Score;

                contextBuilder.AppendLine($"## From: {title} (relevance: {score:F2})");
                contextBuilder.AppendLine(text);
                contextBuilder.AppendLine();
            }

            // 4. Build prompt
            var systemPrompt = BuildSystemPrompt(requestType);
            var userPrompt = BuildUserPrompt(currentDraft, contextBuilder.ToString(), requestType);

            // 5. Generate with LLM
            var suggestion = await _llm.GenerateCompletionAsync(
                systemPrompt: systemPrompt,
                userPrompt: userPrompt,
                temperature: 0.7f);

            return suggestion;
        }

        private string BuildSystemPrompt(string requestType)
        {
            return requestType switch
            {
                "continue" => @"You are a technical blog writing assistant. Your role is to suggest
                    continuations for blog posts based on the author's past writing style and content.

                    Guidelines:
                    - Match the author's voice and technical depth
                    - Use similar patterns and structures from past posts
                    - Be specific and technical, not generic
                    - Include code examples when relevant
                    - Maintain consistency with past content",

                "improve" => @"You are a technical blog editor. Your role is to improve sections
                    of blog posts while maintaining the author's voice.

                    Guidelines:
                    - Preserve the author's style
                    - Improve clarity and flow
                    - Add technical depth where appropriate
                    - Suggest better examples from past posts
                    - Fix unclear explanations",

                "outline" => @"You are a technical blog outline generator. Your role is to suggest
                    outlines for new blog posts based on past structures.

                    Guidelines:
                    - Study the author's typical post structure
                    - Suggest sections based on successful past posts
                    - Include technical depth appropriate to topic
                    - Reference similar past articles",

                _ => "You are a helpful technical writing assistant."
            };
        }

        private string BuildUserPrompt(string currentDraft, string context, string requestType)
        {
            return $@"
# Current Draft
{currentDraft}

# Relevant Past Content
{context}

# Request
{GetRequestDescription(requestType)}

Please provide your suggestion based on the current draft and the relevant past content shown above.
Remember to maintain consistency with the author's past writing style and technical approach.
";
        }

        private string GetRequestDescription(string requestType)
        {
            return requestType switch
            {
                "continue" => "Continue writing from where the draft ends. Suggest the next 1-2 paragraphs.",
                "improve" => "Improve the current draft. Suggest specific edits and enhancements.",
                "outline" => "Create a detailed outline for completing this post.",
                _ => "Provide helpful suggestions."
            };
        }
    }
}

Virtaus toimii täydellisesti

using Microsoft.Extensions.Configuration;
using Microsoft.Extensions.DependencyInjection;
using Microsoft.Extensions.Logging;

namespace BlogRAG.Console
{
    class Program
    {
        static async Task Main(string[] args)
        {
            // Setup DI and configuration
            var services = new ServiceCollection();

            var configuration = new ConfigurationBuilder()
                .SetBasePath(Directory.GetCurrentDirectory())
                .AddJsonFile("appsettings.json")
                .AddUserSecrets<Program>()  // For API keys
                .Build();

            services.AddLogging(builder => builder.AddConsole());

            // Register services
            var embeddingConfig = configuration.GetSection("BlogRAG:Embedding");
            services.AddSingleton<IEmbeddingService>(sp =>
                new OpenAIEmbeddingService(
                    embeddingConfig["ApiKey"]!,
                    embeddingConfig["Model"]!,
                    sp.GetRequiredService<ILogger<OpenAIEmbeddingService>>()));

            var llmConfig = configuration.GetSection("BlogRAG:LLM");
            services.AddSingleton<ILLMService>(sp =>
                new ClaudeLLMService(
                    llmConfig["ApiKey"]!,
                    llmConfig["Model"]!,
                    sp.GetRequiredService<ILogger<ClaudeLLMService>>()));

            var vectorConfig = configuration.GetSection("BlogRAG:VectorStore");
            services.AddSingleton(sp =>
                new QdrantVectorStore(
                    vectorConfig["Url"]!,
                    vectorConfig["ApiKey"] ?? "",
                    vectorConfig["CollectionName"]!,
                    sp.GetRequiredService<ILogger<QdrantVectorStore>>()));

            services.AddSingleton<IngestionService>();
            services.AddSingleton<RAGGenerationService>();

            var serviceProvider = services.BuildServiceProvider();

            // Run CLI
            await RunCLI(serviceProvider, configuration);
        }

        static async Task RunCLI(ServiceProvider serviceProvider, IConfiguration configuration)
        {
            System.Console.WriteLine("=== Blog RAG Assistant ===\n");
            System.Console.WriteLine("Commands:");
            System.Console.WriteLine("  ingest - Ingest markdown files");
            System.Console.WriteLine("  write - Start writing session");
            System.Console.WriteLine("  quit - Exit\n");

            while (true)
            {
                System.Console.Write("> ");
                var command = System.Console.ReadLine()?.Trim().ToLower();

                switch (command)
                {
                    case "ingest":
                        await IngestCommand(serviceProvider, configuration);
                        break;
                    case "write":
                        await WriteCommand(serviceProvider);
                        break;
                    case "quit":
                        return;
                    default:
                        System.Console.WriteLine("Unknown command");
                        break;
                }
            }
        }

        static async Task IngestCommand(ServiceProvider serviceProvider, IConfiguration configuration)
        {
            var ingestion = serviceProvider.GetRequiredService<IngestionService>();
            var markdownPath = configuration["BlogRAG:Ingestion:MarkdownPath"];

            System.Console.WriteLine($"Ingesting from {markdownPath}...");
            await ingestion.IngestMarkdownFilesAsync(markdownPath!);
            System.Console.WriteLine("Ingestion complete!\n");
        }

        static async Task WriteCommand(ServiceProvider serviceProvider)
        {
            var rag = serviceProvider.GetRequiredService<RAGGenerationService>();

            System.Console.WriteLine("\nEnter your draft (end with empty line):");
            var draft = new StringBuilder();
            string? line;

            while (!string.IsNullOrWhiteSpace(line = System.Console.ReadLine()))
            {
                draft.AppendLine(line);
            }

            System.Console.WriteLine("\nGenerating suggestion...\n");
            var suggestion = await rag.GenerateSuggestionAsync(draft.ToString());

            System.Console.WriteLine("=== Suggestion ===");
            System.Console.WriteLine(suggestion);
            System.Console.WriteLine("\n");
        }
    }
}

Kustannukset

Claude 3.5 Sonnet: 3 miljoonaa dollaria, 15 miljoonaa dollaria ja ulostulo

# 1. Clone/create project
dotnet new console -n BlogRAG
cd BlogRAG

# 2. Add packages
dotnet add package Qdrant.Client
dotnet add package OpenAI
dotnet add package Anthropic.SDK
dotnet add package Microsoft.Extensions.Configuration.Json
dotnet add package Microsoft.Extensions.Configuration.UserSecrets

# 3. Set API keys (stored securely)
dotnet user-secrets init
dotnet user-secrets set "BlogRAG:Embedding:ApiKey" "sk-..."
dotnet user-secrets set "BlogRAG:LLM:ApiKey" "sk-ant-..."

# 4. Start Qdrant (local)
docker run -d -p 6333:6333 qdrant/qdrant

# 5. Run ingestion
dotnet run
> ingest

# 6. Start writing
> write

Tyypillinen blogin kirjoitussessio (20K syöte, 2K ulostulo): noin 0,09 dollariaKuukausittainen käyttö (10 istuntoa): noin 0,90 dollaria kuukaudessa

Nämä ovat ballpark-lukuja, jotka perustuvat ensimmäisiin kokeisiini - kilometrimääräsi voi vaihdella riippuen siitä, kuinka puhelias olet tekoälyn kanssa.

# Start Qdrant (if using local Docker)
docker start qdrant

# Run assistant
dotnet run
> write

# Enter your draft
I've been working on a new feature that uses Entity Framework Core...
[Ctrl+D or empty line]

# Get AI suggestion based on your past EF posts!

3.

Qdrant Vector Store (Sama kuin alkuperäinen!)

Sama API kuin paikallinen asetusOsoita vain paikalliseen Dockeriin tai Qdrant Cloudiin!

Nielemisputki |-----------|--------|------| RAG Generation Service Yksinkertainen konsoliasiakas Järjestelmän käyttö | Ensikertalaisasettelu | | ~$3.65 |

Kokonaisasetteluaika

  • : noin 15 minuuttia vs. noin 2 tuntia paikalliseen GPU-asetukseen - olettaen, että kaikki sujuu sujuvasti, mikä on kokemukseni mukaan vaarallinen oletus.
  • Päivittäinen käyttö
  • Kustannusanalyysi

**Kuukausittainen kustannusarvio (Henkilökohtainen blogi)**Skenaario

: Kirjoittaa 4 blogikirjoitusta kuukaudessa

  1. Operatiivinen toiminta Osa-alue Kustannukset:

    • text-embedding-3-smallAlkuperäinen nieleminen (100 virkaa) Kertamaksu, 500 000 kuponkia 0,05 dollaria
    • text-embedding-3-largeUppoutukset (vihjeet, 40/kuukausi) 40 000 dollaria
    • LLM kutsuu (40 ehdotusta) 800 000 syöttöä, 80 000 ulostulo 3,60 dollaria
  2. Kuukausittain yhteensäVertailun vuoksi:

    // Use OpenAI Batch API for ingestion
    var batch = await client.CreateBatchAsync(requests);
    // Wait hours, pay half price
    
  3. Paikallinen asetus: $0/kk (mutta $800+ GPU etukäteen):

    // Don't re-embed identical text
    var cache = new Dictionary<string, float[]>();
    
  4. ChatGPT Plus: 20 dollaria kuukaudessa (ei aluetukia, yleinen):

    • Grammarly Premium: 12 dollaria kuukaudessa (ei tekoälyn kirjoittamista)
    • Even-piste
  5. : Jos käyttäisit tätä 18+ kuukautta, paikallinen GPU maksaa itse.:

    // Retrieve top 3 instead of top 10 chunks
    limit: 3  // 70% less input tokens
    

Muuten pilvisyys on halvempaa.

Vaikka selvitän vielä, pitävätkö kustannusarvioni paikkansa, saatan syödä sanani muutaman kuukauden kuluttua, kun laskut tulevat.

Kustannusoptimointivinkit |-------|---------|---------|--------|--------| Käytä pienempiä malleja upotuksiin : $0.00002/1K rahakkeet : $0.00013/1K rahakkeet 6,5x kustannusero!

Erä API-puhelut(50 prosenttia halvempi kuin kiireettömällä):

Välipalat upotetaan paikallisesti

// Switch models with one line
services.AddSingleton<ILLMService>(sp =>
    new ClaudeLLMService(  // Was GPT-4, now Claude
        config["ApiKey"],
        "claude-3-5-sonnet-20241022",  // Latest model
        sp.GetRequiredService<ILogger<ClaudeLLMService>>()));

Käytä halvempia malleja luonnoksiinClaude 3,5 Haiku: 0,25 dollaria/M panos (12x halvempi kuin Sonnet)

GPT-4o-mini: 0,15 dollaria/M panos (20x halvempi kuin GPT-4)

# Works on Mac (no CUDA support)
dotnet run  # Just works!

# Works on Linux ARM (Raspberry Pi?)
dotnet run  # Just works!

# Works in Codespaces/Gitpod
dotnet run  # Just works!

Rajaa kontekstiikkuna

Edut paikalliseen asetteluun verrattuna

// Handle 100 concurrent users? Easy with APIs
await Task.WhenAll(users.Select(u =>
    rag.GenerateSuggestionAsync(u.Draft)));

// Local? Limited by your single GPU

1 Täysosuma

bash

Deploy to Azure/AWS/GCP

dotnet publish -c Release

Upload single binary, set env vars, done

Local? Need to:

- Include 12GB model files

- Install CUDA on target machine

- Ensure GPU drivers

logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.