abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
    dnes 04:55 | Nová verze

    Squeak (Wikipedie), open source implementace programovacího jazyka a prostředí Smalltalk, byl vydán ve verzi 6.1. Přehled novinek v poznámkách k vydání.

    Ladislav Hagara | Komentářů: 0
    dnes 04:44 | Bezpečnostní upozornění

    V Linuxu v KVM byla nalezena a v upstreamu již byla opravena kritická zranitelnost Zapscape aneb CVE-2026-64561. Root na hostovaném počítači (virtuální stroj) může obejít izolaci a získat plnou kontrolu nad hostitelským systémem (DoS útok nebo vzdálené spuštění kódu s právy roota). Na obou hlavních architekturách – Intel i AMD. Zranitelnost v Linuxu existovala 6 let (od července 2020 do července 2026).

    Ladislav Hagara | Komentářů: 0
    včera 19:00 | IT novinky

    Počítačová hra Knytt napsaná v Multimedia Fusion 2 byla vydána před 20 lety. Při této příležitosti byl dnes představen moderní port (YouTube) této plošinovky na současné operační systémy pod názvem Knytt Classic. Je zdarma k dispozici na Steamu a GOG.com.

    Ladislav Hagara | Komentářů: 0
    včera 16:00 | IT novinky

    Americká technologická společnost Meta Platforms představila nový model umělé inteligence (AI) Muse Glimmer. Model je menší než přední modely AI od konkurence a má běžet přímo na počítačích uživatelů. Meta model zpřístupní jako open source, tedy otevřený software. Nový model je navržen tak, aby zvládal takzvané agentní úkoly na počítačích se spotřebitelskou grafickou kartou. Klade si tak za cíl uspokojit poptávku po systémech AI, které běží přímo na zařízeních uživatelů.

    Ladislav Hagara | Komentářů: 8
    včera 12:11 | Pozvánky

    V pátek 28. srpna 2026 se v pražském Karlíně uskuteční již osmý Mobilní Hackday. Akce začne v 10:00 a potrvá až do večera. Setkání proběhne v prostorách SUSE Linux, s.r.o. na adrese Křižíkova 148/34, Praha 8 – Karlín. Nejbližší zastávkou je Křižíkova, kam se lze dostat tramvají i metrem. Na programu budou například novinky z posledních měsíců, možnosti, jak si zjednodušit práci s LLM/AI, a také nová linuxová distribuce BengalOS, včetně … více »

    David Heidelberg | Komentářů: 0
    9.8. 17:22 | Nová verze

    Jakub Vrána vydal Adminer ve verzi 6.0.0 s více než 130 změnami: "Většina změn vznikla s asistencí Claude Opus 5. Někteří lidi se bojí, že AI asistence může kód zamořit technickým dluhem. To je jistě pravda, pokud vývojář všechny změny bezduše odbouchne Enterem. Ale pokud si pořádně projde plán, vyjedná v něm změny a pak totéž udělá i s vygenerovaným kódem, kvalita kódu stoupne a technický dluh naopak klesne. Je to jako párové programování s

    … více »
    Ladislav Hagara | Komentářů: 1
    9.8. 12:44 | Nová verze

    Sam Aaron vydal novou major verzi 5.0.0 aplikace Sonic Pi (Wikipedie) určené také pro výuku programování pomocí skládání hudby. Přehled novinek na GitHubu. Instalovat lze také z Flathubu.

    Ladislav Hagara | Komentářů: 0
    8.8. 04:44 | IT novinky

    U příležitosti 30. výročí vydání počítačové hry Quake byla vydána nová epizoda s názvem Dawn of the Machine (Steam).

    Ladislav Hagara | Komentářů: 8
    7.8. 16:00 | Bezpečnostní upozornění

    Vládní CERT upozorňuje (𝕏) na sérii bezpečnostních záplat (CVSS 9.9) v produktech Cisco řešících kritické zranitelnosti umožňující obejití autentizace, eskalaci oprávnění, vzdálené spuštění kódu a odepření služby. Úspěšné zneužití může útočníkům umožnit získat neoprávněný přístup k dotčeným systémům, kompromitovat zařízení Cisco Catalyst SD-WAN a Cisco IOS XE, spustit libovolný kód, zpřístupnit citlivé informace nebo narušit dostupnost postižených systémů.

    Ladislav Hagara | Komentářů: 6
    7.8. 15:33 | IT novinky

    Soud v americkém státě Nové Mexiko ve čtvrtek nařídil internetové společnosti Meta Platforms zaplatit 567 milionů dolarů (téměř 12 miliard Kč) za újmy, které její platformy působí mladým lidem. S přihlédnutím k dřívějšímu verdiktu tak má společnost celkem zaplatit 942 milionů dolarů, což je malý zlomek jejího ročního výnosu, který loni činil 60 miliard dolarů. Čtvrteční verdikt firmě také nařizuje, aby změnila způsob, jakým její

    … více »
    Ladislav Hagara | Komentářů: 21
    Které desktopové prostředí na Linuxu používáte?
     (10%)
     (7%)
     (2%)
     (18%)
     (30%)
     (6%)
     (6%)
     (2%)
     (15%)
     (23%)
    Celkem 2364 hlasů
     Komentářů: 30, poslední 3.4. 20:20
    Rozcestník

    Jak na dokument s velkým množstvím „překlepů“

    13.7.2010 11:07 | Ostatní

    Převedl jsem jeden PDF soubor do prostého textu pomocí pdftotext. Problém je, že výsledný soubor obsahuje velké (hodně velké) množství „překlepů“ — tedy spíš ne pravopisné chyby, ale chyby typu: onemocnla (onemocněla), pláem (pláčem), nkdy (někdy)... Jde tedy nejčastěji o chybějící písmenka s diakritikou.

    No a já uvažuju, jak se co nepohodlněji dostat k dokumentu, který oproti původnímu obsahuje minimum chyb a aby to bylo pokud možno automatické, aby to šlo jenom s minimální námahou.

    Jako první možnost mě napadl aspell, jenže u něj jsem nenašel parametry, jak opravu zautomatizovat (v mém případě nutnost). Musel bych tedy mockrát mačkat klávesy, což nechci.

    A u aspellu jsem skončil, protože jsem nenašel (špatně jsem hledal?) jiný nástroj, který by dovedl to, co aspell nedovede (tedy zautomatizovat opravu „překlepů“).

    Budu moc rád, pokud mě aspoň navedete, jak tento problém vyřešit. Předem díky.

           

    Hodnocení: 100 %

            špatnédobré        

    Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

    Komentáře

    Vložit další komentář

    13.7.2010 12:40 ____ | skóre: 15 | blog: _
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“

    Cožpak se nedá mačkání kláves zautomatizovat, vyberu-li to nejhloupější řešení?

    Jinak mám dojem, že je aspell knihovna, takže bys si snad mohl třeba v nějakém Pythonu nebo kdovíčem napsat skript.

    Nepředpokládám, že by naprogramování něčeho takového stálo moc úsilí i relativní neprogramátory.

    13.7.2010 13:14 Begleiter | skóre: 47 | blog: muj_blog | Doma
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“

    Jinak mám dojem, že je aspell knihovna, takže bys si snad mohl třeba v nějakém Pythonu nebo kdovíčem napsat skript.

    Nepředpokládám, že by naprogramování něčeho takového stálo moc úsilí i relativní neprogramátory.

    Ano, toto je řešení. Díky. Stejně jsem se naučit aspoň základy Pythonu chystal. Určitě by šel použít i Perl, ale Python bude asi pro začátečníka jako jsem já vhodnější.

    13.7.2010 13:38 Zdenek
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“
    Chapu to tak ze puvodni PDF je v poradku? Jestli ano, pak jdete naprosto nesmyslnou cestou.
    13.7.2010 13:40 ____ | skóre: 15 | blog: _
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“
    +1, to jsem v textu nějak přehlédl.
    13.7.2010 14:04 R
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“
    Mnohe PDF nie su vporiadku, len to tak vyzera. Niektore programy pri vytvarani PDF diakritiku znicia - nahradia bitmapami, skladaju z roznych divnych znakov a pod.
    13.7.2010 14:14 CEST
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“
    No, chtel jsem napsat, ze resenim je spravne nastaveni znakove sady/kodovani pri konvertovani.

    Nejsem si jistej, ale pokud by neco nahrazovalo v PDF cesky znaky bitmapama, tak by to musel byt taky docela slozitej algoritmus, protoze je jednodussi v PDF vygenerovat cesky text pomoci znaku (v jakymkoliv kodovani) nez zjistovat font, generovat bitmatu v tomtu fontu pro prislusny cesky znak, puvodni cesky znak nahradit stejne sirokou mezerou a pak propocitavat umisteni tehle mezery, resp. umisteni toho ceskeho bitmap znaku, aby bylo to pismeno spravne vertikalne a horizontalne usazene. Takhle by to snad naprogramoval jenom idiot.

    Spis tam bude opravdu problem s kodovanim. Zatimco pdftotext pouziva kodovani "A", PDF je kodovani pomoci "B". Zkusil by se zamerit na tohle a hledat na google.
    13.7.2010 14:47 Jirka P
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“
    Nejsem si jistej, ale pokud by neco nahrazovalo v PDF cesky znaky bitmapama, tak by to musel byt taky docela slozitej algoritmus
    Fakt ne, rozhodně ne složitější, než jak se to renderuje na obrazovku.
    Nejsem si jistej, ale pokud by neco nahrazovalo v PDF cesky znaky bitmapama, tak by to musel byt taky docela slozitej algoritmus
    Vzhledem k tomu, že PDF je prezentační formát, dělají to tak všichni, kterým záleží na přesném zobrazení toho, co si přejí. Spíš než na bitmapy se to převádí na křivky (na bitmapy jsou převedené spíš dokumenty zkonvertované z PS s bitmapovými fonty), ale z hlediska kopírování to vyjde nastejno. Často je to tak, že PDF v sobě má něco jako "font", ale v kódování, které je ad hoc vytvořeno pro daný dokument. Vizte např. tento dokument a zkuste si s ním pohrát.
    13.7.2010 14:58 Begleiter | skóre: 47 | blog: muj_blog | Doma
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“
    Spis tam bude opravdu problem s kodovanim. Zatimco pdftotext pouziva kodovani "A", PDF je kodovani pomoci "B". Zkusil by se zamerit na tohle a hledat na google.

    Problém je ten, že u pdftotext lze nastavit pouze výstupní kódávní pomocí -enc, ale vstupní nějak detekuje sám.

    13.7.2010 15:12 Begleiter | skóre: 47 | blog: muj_blog | Doma
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“

    Původní PDF je v pořádku. Jakou cestou bych teda měl jít?

    13.7.2010 15:42 Tomáš
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“
    Pohrej si s nastavením kódování při převodu. Při troše štěstí dostaneš pěkný text s háčky a čárkami. V o trošku horším případě dostaneš něco, kde je místo českých znaků nějaká divná sekvence, a ty už si nahradíš strojově.
    13.7.2010 16:05 Begleiter | skóre: 47 | blog: muj_blog | Doma
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“

    Takto jsem převedl PDF soubor do plain textu:

    pdftotext -enc UTF-8 soubor.pdf soubor.txt
    

    Místo znaků s diakritikou jsem dostal divnou sekvenci. Teď zbývá nahradit ty divné znaky správnými znaky s diakritikou. Vypadá to dobře. Díky. Nahrazuju to v geditu.

    16.7.2010 08:37 asdf
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“
    prohnal bych to pdf printerem, v output nastaveni misto pdf vybral jpg, tim bych ziskal cely pdf dokument prevedeny do obrazku. vsechny obrazky oznacit, vlozit do ocr programu a za dve minuty neni co resit!
    13.7.2010 16:57 Begleiter | skóre: 47 | blog: muj_blog | Doma
    Rozbalit Rozbalit vše Re: Jak na dokument s velkým množstvím „překlepů“

    Takže řešení je prosté: Nejdřív převést pomocí pdftotext soubor do plain textu: pdftotext -enc UTF-8 soubor.pdf soubor.txt Potom pomocí nějakého nástroje (já použil gedit, ale můžete určitě použít sed apod.) nahradíte "klikyháky" za české znaky s diakritikou.

    Založit nové vláknoNahoru

    ISSN 1214-1267   www.czech-server.cz
    © 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.