Portál AbcLinuxu, 30. dubna 2025 15:45
Taky vás tak prudí, kolik místa zabírají DVD s filmy stažená na disk? Mě děsně. Protože však nemám dost času ani na to abych je vůbec stíhal zkouknout, natož zkonvertovat do únosnějšího objemu, píšu si na to skriptík, se kterým by šlo pracovat dávkově.
Na rozdíl od mých poloslepých žen preferuji u filmu originální znění s titulky, proto by měl skript produkovat dual avi + soubor s titulky a fungovat po spuštění pokud možno bez nějaké další asistence. Proto jsem potřeboval nějakou OCR utilitu, co by produkovala alespoň částečně použitelný výsledek.
Před nějakým časem jsem zkoušel extrahovat titulky pomocí dvdsub
i pgm2srt
, ale s výsledkem jsem moc spokojen nebyl. Druhý zmíněný na tom byl sice přeci jen o něco lépe než ten první, co používá jako backend gocr
ale pořád nic moc. Proto jsem se kouknul v Synapticu co v oblasti OCR Debian aktuálně nabízí.
Název aplikace cuneiform
mi nic moc neříkal, tak jsem ji vyzkoušel jako první. Předhodil jsem jí jeden starý sken stránky ze samizdatového časopisu, co se mi zrovna válel v domovském adresáři a nestačil se divit. Ve výsledném textu byly pouze dvě problémové věci. Nejčastější chybou byla záměna "í" (většinou za písmeno "f") a špatně byly rozpoznané pouze dvě slova, které byly v kurzívě. Podotýkám předem, že kvalita skenu byla spíš lepší než horší, ale na rozdíl od ostatních cuneiform
nezmátla grafika na stránce.
Tesseract jsem zkoušel již dřív, a jelikož nemá podporu pro češtinu, tak jsem jej vynechal rovnou. Výsledek který vyprodukoval gocr a ocrad - škoda slov. Takže jednoznačným favoritem pro můj skript se stal cuneiform
. O této aplikaci zde zatím jak se zdá zmínka nepadla, tak proto tento zápis.
Tiskni
Sdílej:
a zrovna sem se ho chystal dneska vyzkouset, zeby nahoda?
nevim jestli je to koser, linkovat ke konkurenciNení! Smrt Rootu!
Program super, ale nejak nechapu, co ma spolecneho OCR s tim, ze pri grabovani DVD se ma ulozit
soubor s titulky?
a to to jako skenujes z ceho ty titulky? je mas nekde vytisteny na papire?
Avidemux má cli rozhranie, ale neviem ako je použiteľné a pri OCR ako som písal je potrebná interakcia.Také používám avidemux, ale už jen na úpravu hotového videa. Pokud jde o to OCR - to je právě výhoda cuneiform - není nutná interakce a výsledek je natolik kvalitní, že stačí zkontrolovat výsledek přes aspell (opět na konzoli). Avidemux pro OCR nejspíš využívá (podobně jako to dělal
pgm2srt
) toho že se u titulků zase tak moc šumu neobjevuje, takže lze vzorky porovnávat poměrně jednoduše. Kdežto OCR engine který používá cuneiform má (pravděpodobně) zabudovanou i nějakou další logiku. Proto je výsledek dobrý i bez interakce.
takze byste o tom meli minimalne uvazovat
ISSN 1214-1267, (c) 1999-2007 Stickfish s.r.o.