
Česká účetní agenda žije v zajímavé době. Část firem stále přepisuje faktury ručně, část používá OCR systémy z roku 2015 a třetí část už nasazuje AI agenty, kteří faktuře skutečně rozumí. Rozdíl mezi těmito třemi přístupy je dramatický — a má přímý dopad na náklady, chyby a rychlost uzávěrky.
V tomto článku rozebereme, jak se klasické OCR liší od moderního AI vytěžování, kde se peníze ztrácí, kdy se vyplatí přejít a jak vypadá realistická implementace v české firmě napojené na Pohodu, Money S5, Helios nebo ABRA.
1. Co je vlastně OCR a co je AI vytěžování
Lidé to často zaměňují. Krátce:
Klasické OCR (Optical Character Recognition)
Technologie z 90. let. Naskenuje obrázek, převede ho na text. Tečka. Nerozumí, co text znamená. Pokud chcete z faktury vytěžit dodavatele, IČO, datum splatnosti a celkovou částku, musíte na výstup OCR navázat pravidla — typicky regex výrazy, šablony nebo trénované zóny. To funguje, dokud dostáváte faktury od stejných dodavatelů ve stejném layoutu. Jakmile přijde nová faktura nebo dodavatel změní formát, systém spadne.
AI vytěžování (LLM-based extraction)
Moderní přístup. AI agent dostane fakturu (PDF, sken, e-mail) a sám identifikuje strukturu — najde dodavatele, čísla, položky, DPH. Nepotřebuje šablony. Když přijde úplně nový layout, který ještě nikdy neviděl, stejně to odbaví. A navíc rozumí kontextu — pozná rozdíl mezi „částka k úhradě“ a „částka před DPH“, i když jsou popsané různě.
2. Kde klasické OCR selhává — 5 reálných problémů
Problém 1: Šablonová slepota
Klasické OCR funguje na bázi šablon nebo trénovaných zón. „Dodavatel je v levém horním rohu, IČO 3 cm pod ním.“ Funguje skvěle, dokud nepřijde dodavatel, který má dodavatelské údaje v patičce. Pak se musí udělat nová šablona. U české firmy s 200+ dodavateli to je pravidelná údržba, která stojí 15–40 hodin měsíčně.
Problém 2: Ruční obrázky a fotky z mobilu
Když řidič vyfotí účtenku z benzinky pod úhlem, klasické OCR se ztratí. Fotka je pootočená, světlo na pozadí, písmo nezarovnané. Moderní AI s vision modely (GPT-4o vision, Claude vision) si s tím poradí — pochopí, že vidí účtenku, dohledá údaje a vyplní strukturovaný výstup.
Problém 3: Ne-strukturované dokumenty
Faktury z drobných dodavatelů, vyúčtování od taxíků, dohody o provedení práce, příjmové doklady — tyto dokumenty nemají standardní formát. OCR si neporadí. AI ano.
Problém 4: Chyby v rozpoznávání čísel
Klasické OCR si plete 0/O, 1/l/I, 5/S. Z faktury 5 380 Kč udělá 53 SO Kč. Při 1 000 fakturách měsíčně to znamená 30–80 chyb, které někdo musí najít a opravit. AI vytěžování má kontextovou kontrolu — pokud položka říká 53 SO, ví, že to nedává smysl, a opraví se.
Problém 5: Žádné porozumění
OCR vám vrátí surová data. Nepozná, že dvě faktury od stejného dodavatele ze stejného dne s podobnou částkou jsou s velkou pravděpodobností duplikáty. Nepozná, že dodavatel poslal fakturu s chybným IČO. Nepozná, že platba má být v EUR, ne CZK. AI agent tyto věci vidí a flaguje je.
3. Konkrétní srovnání — měřená data z reálného nasazení
V Apertii jsme v roce 2025 nasazovali AI vytěžování u středně velké české distribuční firmy. Měli předtím klasické OCR řešení od roku 2017. Měřili jsme dva měsíce paralelně.
| Metrika | Klasické OCR | AI vytěžování |
|---|---|---|
| Přesnost rozpoznání hlavičky | 91 % | 98,5 % |
| Přesnost rozpoznání položek | 74 % | 96 % |
| Schopnost odbavit nový layout | 0 % | 92 % |
| Čas na ruční doplnění/opravu | 4,2 min/fakturu | 0,6 min/fakturu |
| Měsíční čas účetní (1200 faktur) | 84 hodin | 12 hodin |
| Ušetřené FTE | — | 0,5 FTE |
Při hrubé mzdě účetní 45 000 Kč to znamená roční úsporu cca 270 000 Kč jen na mzdových nákladech, plus rychlejší uzávěrka a menší riziko penále z prodlení.
4. Jak vypadá moderní AI vytěžování v praxi
Moderní pipeline pro AI vytěžování faktur má typicky 5 kroků:
Krok 1: Příjem dokumentu
Faktura přijde e-mailem, do datové schránky, sdílené složky nebo se nahraje přes web. Agent všechny zdroje sleduje a shromažďuje na jedno místo.
Krok 2: Klasifikace
AI nejdřív rozhodne — je to faktura přijatá, dobropis, objednávka, paragon, dodací list? Pak aplikuje správnou logiku.
Krok 3: Extrakce strukturovaných dat
Agent identifikuje dodavatele (IČO, DIČ, název, banka), datum vystavení, datum splatnosti, variabilní symbol, jednotlivé položky, sazby DPH, celkovou částku. Vše ve strukturovaném formátu (JSON, XML).



