Byla vydána nová stabilní verze 3.16.0, tj. první z nové řady 3.16, minimalistické linuxové distribuce zaměřené na bezpečnost Alpine Linux (Wikipedie) postavené na standardní knihovně jazyka C musl libc a BusyBoxu.
NoLog.cz IT kolektiv spustil Nitter.cz. Jedná se o alternativní rozhraní pro Twitter, které nesbírá osobní údaje, nevyžaduje přihlášení a všechny přístupy na Twitter provádí skrz servery NoLog.cz.
Byla vydána nová major verze 15 softwarového nástroje s webovým rozhraním umožňujícího spolupráci na zdrojových kódech GitLab (Wikipedie). Představení nových vlastností i s náhledy a videi v oficiálním oznámení.
Po 9 týdnech vývoje od vydání Linuxu 5.17 oznámil Linus Torvalds vydání Linuxu 5.18 (LKML). Přehled nových vlastností a vylepšení na stránce Linux Kernel Newbies.
V Ubuntu 22.10 s kódovým jménem Kinetic Kudu bude zvukový server PulseAudio nahrazen multimediálním serverem PipeWire.
Tavis Ormandy popisuje, jak zprovoznil 32 let starý unixový port tabulkového procesoru Lotus 1-2-3 na moderním Linuxu. Doprovodné zdrojové kódy jsou na GitHubu.
Po pěti měsících vývoje od vydání verze 250 byla vydána nová verze 251 správce systému a služeb systemd (GitHub, NEWS).
HP ve spolupráci se System76 představil 14" notebook HP Dev One s procesorem AMD Ryzen 7 PRO a předinstalovaným Pop!_OS Linuxem.
Byla vydána verze 1.61.0 programovacího jazyka Rust (Wikipedie). Podrobnosti v poznámkách k vydání. Vyzkoušet Rust lze například na stránce Rust by Example.
Správce nástroje curl Daniel Stenberg na GitHubu průběžně vytváří svou novou knihu Uncurled, v níž shrnuje své dlouhodobé zkušenosti s údržbou open-source projektu: od odpozorovaných pouček po vtipné a ne až tak vtipné příklady e-mailů od uživatelů.
Taky vás tak prudí, kolik místa zabírají DVD s filmy stažená na disk? Mě děsně. Protože však nemám dost času ani na to abych je vůbec stíhal zkouknout, natož zkonvertovat do únosnějšího objemu, píšu si na to skriptík, se kterým by šlo pracovat dávkově.
Na rozdíl od mých poloslepých žen preferuji u filmu originální znění s titulky, proto by měl skript produkovat dual avi + soubor s titulky a fungovat po spuštění pokud možno bez nějaké další asistence. Proto jsem potřeboval nějakou OCR utilitu, co by produkovala alespoň částečně použitelný výsledek.
Před nějakým časem jsem zkoušel extrahovat titulky pomocí dvdsub
i pgm2srt
, ale s výsledkem jsem moc spokojen nebyl. Druhý zmíněný na tom byl sice přeci jen o něco lépe než ten první, co používá jako backend gocr
ale pořád nic moc. Proto jsem se kouknul v Synapticu co v oblasti OCR Debian aktuálně nabízí.
Název aplikace cuneiform
mi nic moc neříkal, tak jsem ji vyzkoušel jako první. Předhodil jsem jí jeden starý sken stránky ze samizdatového časopisu, co se mi zrovna válel v domovském adresáři a nestačil se divit. Ve výsledném textu byly pouze dvě problémové věci. Nejčastější chybou byla záměna "í" (většinou za písmeno "f") a špatně byly rozpoznané pouze dvě slova, které byly v kurzívě. Podotýkám předem, že kvalita skenu byla spíš lepší než horší, ale na rozdíl od ostatních cuneiform
nezmátla grafika na stránce.
Tesseract jsem zkoušel již dřív, a jelikož nemá podporu pro češtinu, tak jsem jej vynechal rovnou. Výsledek který vyprodukoval gocr a ocrad - škoda slov. Takže jednoznačným favoritem pro můj skript se stal cuneiform
. O této aplikaci zde zatím jak se zdá zmínka nepadla, tak proto tento zápis.
Tiskni
Sdílej:
a zrovna sem se ho chystal dneska vyzkouset, zeby nahoda?
nevim jestli je to koser, linkovat ke konkurenciNení! Smrt Rootu!
Program super, ale nejak nechapu, co ma spolecneho OCR s tim, ze pri grabovani DVD se ma ulozit
soubor s titulky?
a to to jako skenujes z ceho ty titulky? je mas nekde vytisteny na papire?
Avidemux má cli rozhranie, ale neviem ako je použiteľné a pri OCR ako som písal je potrebná interakcia.Také používám avidemux, ale už jen na úpravu hotového videa. Pokud jde o to OCR - to je právě výhoda cuneiform - není nutná interakce a výsledek je natolik kvalitní, že stačí zkontrolovat výsledek přes aspell (opět na konzoli). Avidemux pro OCR nejspíš využívá (podobně jako to dělal
pgm2srt
) toho že se u titulků zase tak moc šumu neobjevuje, takže lze vzorky porovnávat poměrně jednoduše. Kdežto OCR engine který používá cuneiform má (pravděpodobně) zabudovanou i nějakou další logiku. Proto je výsledek dobrý i bez interakce.
takze byste o tom meli minimalne uvazovat