This is a viewer only at the moment see the article on how this works.
To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk
This is a preview from the server running through my markdig pipeline
Monday, 22 December 2025
अधिकतर “ आपके डेटा के साथ चैट करता है” सिस्टम एक ही गलती करते हैंM SK2 वे LLM को मानो यह एक डाटाबेस है जैसे व्यवहार करता है
वे पंक्तियों को संदर्भ में डालते हैं।
डेटासममारीजर विपरीत दृष्टिकोण लेता है
यह एक संगणित करता है निर्धारणात्मक सांख्यिकी प्रोफाइल आपके डेटासेट को DuckDB , का उपयोग करते हुए उस प्रोफ़ाइल को जारी रखता है वैकल्पिक रूप से layers a स्थानीय एलएलएम इन तथ्यों को समझने के लिए ऊपर से।
परिणाम है
tool JSON)एक मॉडल को कच्चे पङ्क्ति भेजने के बिना सभी
यह सीधे पर बनाता है **C# में स्थानीय LLMs के साथ बड़े सीएसवी फ़ाइलों का विश्लेषण कैसे करें**जिसने मूल विचार को प्रस्तुत किया
LLMs को क्वेरी उत्पन्न करना चाहिए
यह लेख इस विचार को आगे बढ़ाता है
पूरा दस्तावेज़ में रहता है डेटासममारीजर README उपकरण सरल दिखता है. यह नहीं है isn’t मॉडल को भेजा गया
नोट यह नहीं है।
जब टीम एक LLM डेटा विश्लेषण पर बोल्ड करते हैं, वे सामान्यतः तीन चीजों में से एक करता है
200k टोकन संदर्भ विंडो के साथ भी
एलएलएम समूहों को संगणित करने के लिए नहीं बनाया गया है
सही विभाजन अभी भी है
LLM कारण. डाटाबेस संगणना
लेकिन आप बदल कर एक कदम आगे जा सकते हैं क्या के ऊपर LLM कारण
मॉडल डेटा देने के बजाय प्रोफ़ाइल.
एक प्रोफ़ाइल, डेटासेट का एक संचयात्मक सारांश है
यह प्रोफ़ाइल अंतरफलक तर्क और संगणना के बीच
अब मॉडल कर सकता है
कच्चे पंक्तियों को कभी नहीं देखने के बिना
flowchart LR
A[Data file] --> B[DuckDB profiles]
B --> C[Statistical Profile JSON]
C --> D[LLM reasoning step]
D --> E[SQL/tool calls]
E --> F[DuckDB executes locally]
F --> G[Aggregate results]
G --> H[LLM synthesis]
style B stroke:#333,stroke-width:4px
style D stroke:#333,stroke-width:4px
style F stroke:#333,stroke-width:4px
यह परिचित को सुरक्षित करता है LLM → SQL → DuckDB loop, लेकिन यह तथ्यों में एङ्कर करता है
एक प्रोफ़ाइल नीरस उत्तर देता है
इन सवालों को आप सामान्यतः खोजते हैं
प्रोफ़ाइल आपको उन्हें सेकंड में देता है
अगर आप करना LLM को सक्षम करें
प्रोफ़ाइल के साथ केवल संदर्भ
आप नहीं need a bigger model
आपको बेहतर साक्ष्य की जरूरत है
मैंने इसे एक सीएलआई में बदल दिया ताकि मैं यह मनपसंद फ़ाइलों पर चला सकता है - क्रोन और आईसी सहित - बिना हाथ के
विंडोज़ फ़ाइल को ऊपर खिसकाएँ datasummarizer.exe
सीएलआई
datasummarizer mydata.csv
datasummarizer tool -f mydata.csv > profile.json
कि profile.json संविदा है
ओललामा अंतबिन्दु http://localhost:11434 कॉन्फ़िगरेशन योग्य
डिफ़ॉल्ट मॉडल qwen2.5-coder:7b (से अधिरोहित करें --model)
डिफ़ॉल्ट रजिस्ट्री DB: .datasummarizer.vss.duckdb
एसक्यूएल सुरक्षा प्रतिबंध
COPY, ATTACH, INSTALL, CREATE, DROP, INSERT, UPDATE, DELETE, असमर्थ PRAGMAडिफ़ॉल्ट इजाज़त से संरक्षित हैं
datasummarizer -f patients.csv --no-llm --fast
आउटपुट PII के साथ रोगी रिकार्ड (974
── Summary ────────────────────────────────────────────────
974 rows, 20 columns. 4 columns have >10% nulls. 8 warnings.
अधिसूचना फ्लैग छिड़काव जोखिम, उच्चM SK1शून्य स्तंभों, स्थिर क्षेत्रों , और संदिग्ध पहचानकर्ताओं MSC4 सभी डक डीबी द्वारा संगणित
कोई अनुमान नहीं
datasummarizer tool -f patients.csv --store > profile.json
संकुचित आउटपुट
{
"Profile": {
"RowCount": 974,
"ColumnCount": 20,
"ExecutiveSummary": "974 rows, 20 columns. 18 alerts."
},
"Metadata": {
"ProfileId": "0ae8dcc4d79b",
"SchemaHash": "44d9ad8af68c1c62"
}
}
यह डिफ़ाईड करने के लिए डिजाइन किया गया है
एक बार प्रोफाइल मौजूद हो जाएँ तो drift सस्ता हो जाता है
datasummarizer tool -f daily_export.csv --auto-drift --store
यह शून्य बुनियादी ढांचा है।
एक बार जब आप सांख्यिकीय रूप है, तो आप कुछ सचमुच उपयोगी कर सकते हैं
संश्लेषित डेटासेट उत्पन्न करें जो
यह डेमो के लिए आदर्श है।
विश्वसनीयता रिपोर्ट quantifies how close the synthetic data is - rather than hand
--no-llm आईसी या विनियमित परिवेशों के लिए उपयुक्त पूर्ण रूप से लेखापरीक्षा योग्य आउटपुट का उत्पादन करता हैएलएलएम तथ्यों को कभी नहीं खोजता
रेपो https://githubMSC1com/scottgalM SK3mostlylucidwebMST4treeMSP5mainMSSK6Mostly LucidMSS7DataSummarizer
आवश्यकताएं:
संबंधित:
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.