← Všechny projekty
Case Study · 04

Market Data
Architecture.

Klient Fintech (Londýn)
Typ Data pipeline
Stack Python · SEC · NLP
Rozsah 62M slov · 901 filingů
62M
Slov zpracováno
901
SEC filingů naindexováno
8 000+
Tickerů pokryto
1
Dev na celé vrstvě
Zadání

Raw data in.
Signal out.

The setup.

ProblemDATA JE VŠUDE — A NIKDE
Trh utopěný v dokumentech62M SLOV, NULA STRUKTURY
SEC EDGAR je zlatá žíla — ale syrová. Tisíce filingů, megabajty HTML, žádný jednotný formát. Pro analytika je to šum. Klient potřeboval z toho dostat signál, ne další archiv.
!SEC EDGAR RAW
SolutionPIPELINE, NE SKLAD
Datová vrstva na míruINGEST → CLEAN → INDEX
Postavil jsem kompletní architekturu: automatizovaný ingest z EDGARu, parsování, čištění a indexace 901 filingů do struktury, na které se dá počítat. Z 62 milionů slov se stala dotazovatelná databáze — připravená pro analytiku v reálném čase.
✓MARKET DATA LAYER
Jak

Ingest.
Clean.
Index.

The flow.

01INGEST
Pull from EDGAR.AUTOMATED
Automatizovaný sběr filingů přímo z SEC EDGAR. Rate-limit aware, idempotentní, odolný vůči výpadkům — běží bez dozoru.
↓SEC EDGAR API
02PARSE
HTML to structure.62M WORDS
Surové HTML filingy rozparsovány na sekce, tabulky a text. Extrakce relevantních částí, normalizace formátů. Šum ven, data dovnitř.
{ }PYTHON NLP
03CLEAN
Normalize & dedupe.901 FILINGS
Čištění, deduplikace, validace. Jednotný schéma napříč tisíci dokumentů. Data, kterým se dá věřit.
✓SCHEMA-FIRST
04INDEX
Query-ready.REAL-TIME
Indexace do dotazovatelné vrstvy. Analytik se zeptá — data odpoví. Základ pro DCF, sentiment i scítací modely nahoru.
→POSTGRES + INDEX

The stack.

IngestPYTHON
Async pipelineRATE-LIMIT AWARE
Python async workery pro paralelní sběr dat z EDGARu. Retry logika, perzistence stavu, idempotence kroků.
∑PYTHON 3.12
ProcessNLP
Parsing & extraction62M WORDS
HTML/text parsing, sekce, tabulky, normalizace. NLP vrstva pro extrakci klíčových údajů z filingů.
{ }NLP PIPELINE
StoreDATA
PostgreSQLSCHEMA-FIRST
Strukturované úložiště s jednotným schématem. Indexy pro rychlé dotazy napříč 901 filingů a 8 000+ tickerů.
∧POSTGRES
ServeAPI
Query layerREST
API vrstva, která data zpřístupní analytice a modelům. Základ pro DCF enginy, sentiment a portfolio nástroje.
→QUERY-READY
Scale62M
Built for volume8 000+ TICKERS
Architektura navržená tak, aby unesla objem — 62 milionů slov není strop, je to start. Roste s daty.
∞BUILT TO SCALE
OwnSOLO
Jeden dev, celá vrstvaEND-TO-END
Od ingestu po API jeden člověk. Žádný data team, žádné handoffy — jedna hlava, která vidí celý tok dat.
LLAYERS
„62 milionů slov syrových dat.
Jedna struktura, na které se dá stavět.“
— Fintech klient · Londýn
Další case study

FIP Finance →

AI analýza akcií · Monte Carlo DCF

Need this?

Data, fintech, AI. Jeden dev z Brna, dlouhodobě.

Let's ship→

NO PITCH · NO SPAM · STRAIGHT ANSWER