Useimmat “chat-järjestelmät tekevät samaa virhettä tietojen kanssa ”järjestelmät kohtelevat LLM:tä kuin se olisi tietokanta
Ne siirtävät rivit kontekstiin, sijoittaa osia, tai valitsee M SK2 esikuvaesimerkkejä ” ja toivoo, että malli voi päätellä rakenteestaMSC4 laatuaMST5 ja totuutta naamioiden perusteellaMSV6 Se toimii riittävän hyvin demonstrointiin SSK7 ja sitten romahtaa mittakaavan alapuolellaMSP8 yksityisyyden suojaan kohdistuvat rajoituksetMSR9 tai peruskysymykset, kuten “ on tämä pilari jäteMSL11
DataSummarizer käyttää päinvastaista lähestymistapaa.
Se laskee deterministinen tilastollinen profiili DuckDB, käyttämästänne tietokokonaisesta säilyy se profiili, valinnaisesti vaiheet a paikallinen LLM ensiksi tulkita näitä tosiasioita, ehdottaa turvallista lukemista-onnistaan SQLM SK2 ja opastaa seurantaanMSC3 analysoida uudelleenMST4 raskaan nostamisen on oltava numeroista MST5 tilintarkastettavaaMTS6 ja nopeaa MTS7 LLM on tarkoituksellisesti rajoitettu perusteluihin ja esittelyyn
Tulos on:
tool JSON)Kaikki ilman raaka-arvojen lähettämistä malliin.
Tämä perustuu suoraan Miten analysoida suuria CSV-ファイルjä paikallisten LLM:ien avulla C#,, jossa otettiin esille keskeinen ajatus
LLM:iden pitäisi tuottaa kysymyksiä, ei kuluttaa tietoja.
Tämä artikkeli vie tätä ajatusta eteenpäin:
Täsmällinen asiakirja on DataSummarizerin README Työkalu näyttää yksinkertaiselta. Se ei ole’tM SK2 Suurin osa työstä on on’t lähetetään mallille.
Huomautus: Tämä ei ole’t M SK1 vielä . Se’ on tarkoituksenmukainenMSC4 Interfejs on vakaaMST5 reunaa on edelleen syvennettyMSV6
Kun ryhmät panevat LLM:n tietoanalyysiin, ne tekevät yleensä yhden kolmesta asiasta.
Jopa 200k token konteksti-ohjelmien kanssa, tämä on väärä abstraktioM SK2
LLM:iden tarkoituksena ei ole laskea agregaatioita, havaita epäjohdonmukaisuutta , tai perustella luotettavasti jakeluominaisuuksia lukemalla ryhmiäM SK2 He hallucinaoivat, koska heitä pyydetään tekemään tietokannan työtä.
Oikea jakautuminen on edelleen:
LLM-syyt. Tietokantakomputit.*
Voimme kuitenkin mennä vielä pidemmälle muuttamalla mitä LLM:n syyt yli .
Sen sijaan, että annetaan mallia koskevat tiedot, antakaan sille profiili.
Profili on compact, tietokokonaisuuden deterministisen yhteenvedon tiivistelmä
Tästä profiilista tulee yhteys johdonmukaisuuden ja laskennan välille.
Malli voi nyt:
…ilman, että olisi koskaan nähty raaka-aita
flowchart LR
A[Data file] --> B[DuckDB profiles]
B --> C[Statistical Profile JSON]
C --> D[LLM reasoning step]
D --> E[SQL/tool calls]
E --> F[DuckDB executes locally]
F --> G[Aggregate results]
G --> H[LLM synthesis]
style B stroke:#333,stroke-width:4px
style D stroke:#333,stroke-width:4px
style F stroke:#333,stroke-width:4px
Tämä säilyttää tuttun LLM → SQL → DuckDB loop, mutta ankkuroi sen tosiasioihin
Profili vastaa viivytteleviin kysymyksiin.
Nämä ovat kysymykset, joita tavallisesti löydetään.
profiili antaa ne teille sekunnissa.
Jos te lopettaa salli LLM, profiili on se, mikä estää sen toimivuuden
--profiilien ja ainoastaan kontekstin avulla malli voi
Ette tarvitse suurempia malleja
Tarvitaan parempia todisteita.
Muutin tämän CLIksi, jotta voisin käyttää sitä mielivaltaisissa asiakirjoissa - mukaan lukien cron- ja CI-ohjelmien yhteydessä.
Windows-järjestelmä liittää asiakirjan datasummarizer.exe
:
datasummarizer mydata.csv
datasummarizer tool -f mydata.csv > profile.json
Se profile.json on sopimus
Ollaman loppupiste: http://localhost:11434 (configurable)
Standardimalli: qwen2.5-coder:7b (override with --model)
Tavallinen rekisteri DB: .datasummarizer.vss.duckdb
SQL:n turvallisuusrajoitukset:
COPY, ATTACH, INSTALL, CREATE, DROP, INSERT, UPDATE, DELETE, turvaton PRAGMAStandardit ovat tarkoituksellisesti konservatiivisia.
datasummarizer -f patients.csv --no-llm --fast
Tulos (974 PII-potilaiden rekisterit
── Summary ────────────────────────────────────────────────
974 rows, 20 columns. 4 columns have >10% nulls. 8 warnings.
Alarmit lippulaivavuodatusriskejä, korkeatM SK1null-säiliöt, pysyvät kentät , ja epäilyttävät tunnistajat MSC4 kaikki lasketut DuckDB:n tietojen perusteella
Ei arvausta. Ei hallucinaatiotaM SK1
datasummarizer tool -f patients.csv --store > profile.json
Lyhyempi output:
{
"Profile": {
"RowCount": 974,
"ColumnCount": 20,
"ExecutiveSummary": "974 rows, 20 columns. 18 alerts."
},
"Metadata": {
"ProfileId": "0ae8dcc4d79b",
"SchemaHash": "44d9ad8af68c1c62"
}
}
Tämä on suunniteltu diffeerimaksi, talletettavaksiM SK1 ja tarkastettavaksi .
Kun profiilit ovat olemassa, driftistä tulee halpa
datasummarizer tool -f daily_export.csv --auto-drift --store
Se”’” on tuskallinen infrastruktuuri, ”-”, mikä on juuri se, mitä haluatte“.”
Kun teillä on tilastollinen muoto, voitte tehdä jotain todella hyödyllistä.
Synteettiset dataset, jotka:
Tämä on ihanteellinen malli demoille, CIM SK1 tukevien reprojen, ja yhteisiä näytteitä varten
Todenmukaisuuden raportissa mitataan, kuinka lähellä synteettiset tiedot ovat - sen sijaan, että ne olisivat käsillisiäM SK1valokas “realistinen”.
--no-llm tuottaa täysin tilintarkastuskelpoisia tuloksia, jotka soveltuvat CI- tai säänneltyihin ympäristöihin.LLM ei koskaan keksi tosiasioita, vaan reagoi niihin.
Repo: https://github.comM SK2scottgal/mostlylucidwebMST4treeMSSK5mainMSC6Mostly LucidMSS7~DataSummarizer
Vaatimukset:
Related:
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.