abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
    dnes 16:33 | Zajímavý projekt

    Patchouli je open source implementace EMR grafického tabletu (polohovací zařízení). Projekt je hostován na GitLabu.

    Ladislav Hagara | Komentářů: 0
    dnes 14:11 | IT novinky

    Český Nejvyšší soud potvrdil, že česká právní úprava plošného uchování dat o elektronické komunikaci porušuje právo Evropské unie. Pravomocným rozsudkem zamítl dovolání ministerstva průmyslu a obchodu. To se teď musí omluvit novináři Českého rozhlasu Janu Cibulkovi za zásah do práv na ochranu soukromí a osobních údajů. Ve sporu jde o povinnost provozovatelů sítí uchovávat údaje, ze kterých lze odvodit, kdo, s kým a odkud komunikoval.

    Ladislav Hagara | Komentářů: 1
    dnes 02:11 | Komunita

    Google bude vydávat zdrojové kódy Androidu pouze dvakrát ročně. Ve 2. a 4. čtvrtletí.

    Ladislav Hagara | Komentářů: 0
    včera 17:22 | Zajímavý článek

    Bezpečnostní specialista Graham Helton z Low Orbit Security si všímá podezřelých anomálií v BGP, zaznamenaných krátce před vstupem ozbrojených sil USA na území Venezuely, které tam během bleskové speciální vojenské operace úspěšně zatkly venezuelského diktátora Madura za narkoterorismus. BGP (Border Gateway Protocol) je 'dynamický směrovací protokol, který umožňuje routerům automaticky reagovat na změny topologie počítačové sítě' a je v bezpečnostních kruzích znám jako 'notoricky nezabezpečený'.

    NUKE GAZA! 🎆 | Komentářů: 7
    včera 06:11 | Nová verze

    Společnost Valve aktualizovala přehled o hardwarovém a softwarovém vybavení uživatelů služby Steam. Podíl uživatelů Linuxu dosáhl 3,58 %. Nejčastěji používané linuxové distribuce jsou Arch Linux, Linux Mint a Ubuntu. Při výběru jenom Linuxu vede SteamOS Holo s 26,32 %. Procesor AMD používá 67,43 % hráčů na Linuxu.

    Ladislav Hagara | Komentářů: 1
    včera 05:55 | IT novinky

    V Las Vegas probíhá veletrh CES (Consumer Electronics Show, Wikipedie). Firmy představují své novinky. Například LEGO představilo systém LEGO SMART Play: chytré kostky SMART Brick, dlaždičky SMART Tagy a SMART minifigurky. Kostka SMART Brick dokáže rozpoznat přítomnost SMART Tagů a SMART minifigurek, které se nacházejí v její blízkosti. Ty kostku SMART Brick aktivují a určí, co má dělat.

    Ladislav Hagara | Komentářů: 0
    6.1. 18:33 | Bezpečnostní upozornění

    Vládní CERT (GovCERT.CZ) upozorňuje (𝕏) na kritickou zranitelnost v jsPDF, CVE-2025-68428. Tato zranitelnost umožňuje neautentizovaným vzdáleným útočníkům číst libovolné soubory z lokálního souborového systému serveru při použití jsPDF v prostředí Node.js. Problém vzniká kvůli nedostatečné validaci vstupu u cest k souborům předávaných několika metodám jsPDF. Útočník může zneužít tuto chybu k exfiltraci citlivých

    … více »
    Ladislav Hagara | Komentářů: 6
    6.1. 16:22 | Komunita

    V úterý 13. ledna 2025 se v pražské kanceláři SUSE v Karlíně uskuteční 5. Mobile Hackday, komunitní setkání zaměřené na Linux na mobilních zařízeních, kernelový vývoj a související infrastrukturu. Akci pořádá David Heidelberg.

    … více »
    lkocman | Komentářů: 0
    6.1. 16:00 | Pozvánky

    Už je 14 dní zbývá do začátku osmého ročníku komunitního setkání nejen českých a slovenských správců sítí CSNOG 2026. Registrace na akci je stále otevřená, ale termín uzávěrky se blíží. I proto organizátoři doporučují, aby se zájemci přihlásili brzy, nejlépe ještě tento týden.

    … více »
    VSladek | Komentářů: 0
    6.1. 02:22 | Pozvánky

    Rok 2026 sotva začal, ale už v prvním týdnu se nashromáždilo nezvykle mnoho zajímavostí, událostí a zpráv. Jedno je ale jisté - už ve středu se koná Virtuální Bastlírna - online setkání techniků, bastlířů a ajťáků, kam rozhodně doražte, ideálně s mikrofonem a kamerou a zapojte se do diskuze o zajímavých technických tématech.

    Dějí se i ne zcela šťastné věci – zdražování a nedostupnost RAM a SSD, nedostatek waferů, 3€ clo na každou položku z Číny … více »
    bkralik | Komentářů: 0
    Které desktopové prostředí na Linuxu používáte?
     (1%)
     (4%)
     (0%)
     (10%)
     (23%)
     (5%)
     (6%)
     (3%)
     (11%)
     (52%)
    Celkem 271 hlasů
     Komentářů: 7, poslední dnes 15:35
    Rozcestník

    Filtrujme čtivé texty z Projektu Gutenberg 1

    23. 3. 2016 | Karel Kulhavý | Návody | 11520×

    Projekt Gutenberg nabízí přes 20 gigabajtů většinou anglické literatury s prošlým copyrightem. Chceme-li si ale pěkně počíst, narážíme na spoustu děl psaných archaickou angličtinou. Jak vyfiltrovat čtivá díla jednoduše pomocí unixových nástrojů?

    Projekt Gutenberg nenabízí žádné pokročilé rozhraní, které by umožnilo jednotlivá díla vyhledávat pomocí komplexních statistických kritérií. K dispozici jsou offline katalogy, top 100 knih. Top 100 vévodí anglický román rodinného života Pýcha a Předsudek od Jane Austenové z roku 1813 a na druhém místě je Alenka v říši divů. Na čtvrtém místě je Kafka se svou povídkou Proměna.

    Online není možné soubory filtrovat či řadit podle kritérií jako např. četnost výskytu archaismů z dané množiny slov, výskyt přímé řeči a pod. Proto si budeme muset data z Projektu Gutenberg stáhnout nejdříve na náš disk, abychom s nimi mohli pracovat.

    Co je projekt Gutenberg? Projekt Gutenberg je nejstarší existující digitální knihovnou. Založen byl již v roce 1971 Michaelem S. Hartem, americkým veteránem korejské války, který zemřel roku 2011 ve věku 64 let. Centrální idea projektu je publikovat texty, které jsou public domain, protože jim prošel copyright. V každém případě zde tedy najdeme díla řeckých filozofických velikánů. Co když ale intelektuálně sofistikované údery z nejzazších hlubin minulosti nejsou zrovna tím, co bychom chtěli číst, a raději bychom preferovali třeba nějaký román s napínavým příběhem?


    Michael S. Hart (vlevo) a Gregory Newby z Projektu Gutenberg v r. 2006.
    Zdroj: "Marcello" z Wikimedia Commons pod licencí GFDL 1.2

    Od roku 1971, kdy počítače ještě vypadaly jako automatické pračky, projekt Gutenberg nasbíral přes 50 tisíc literárních děl, které jsou uspořádány v souborové hierarchii textových souborů, kde se často vyskytují vícenásobné kopie toho samého souboru, které se liší třeba jen korekturami nebo formátováním mezer. Soubory jsou obsahují prostý text v kódování ASCII nebo UTF-8.

    50 tisíc souborů? To je tedy slušné cvičení na souborový systém. Posuďte sami. Pustíme tento příkaz pouze na zjištění, kolik ten adresář včetně podadresářů zabírá místa. Kontrolka disku se rozsvítí jako baterka a z disku je čteno průměrnou rychlostí cca 1,3 MB/s, ač se jedná jen o souborová metadata. Po 6 minutách kontrolka disku konečně zhasne a dostaví se kýžený výsledek 22 gigabajtů. Toto je doslova příkaz, který pustíte a můžete si jít udělat kafe:

    $ time du -sm pg
    21773	pg
    
    real	5m54.408s
    user	0m3.518s
    sys	0m18.034s

    Nejdříve si toto velké sousto tedy budeme muset zkopírovat z Projektu Gutenberg na náš disk. Použijeme k tomu Rsync:

     rsync --progress -z -urv -v --exclude='GUTINDEX*' --exclude='*-8.txt' --include='*.txt' \
     --include='*/' --exclude='*' --delete --min-size=1 --max-size=10000000 \
    ftp@ftp.ibiblio.org::gutenberg pg

    --progress zapíná indikaci probíhajícího stahování. -z zapíná kompresi, -u přenáší pouze soubory, které byly obnoveny (podle časového razítka) od doby, kdy jsme je stáhli. -r je zcela nezbytná rekurze, pokud chceme stáhnout víc než jednotlivý soubor. -v zvyšuje množství informativních hlášek. Že --exclude a --include vyřazují a zařazují určité druhy souborů je asi jasné, co už ale asi jasné být nemusí je, že --exclude a --include mezi sebou interagují nějakým komplexním způsobem, který je popsán v sekci FILTER RULES manuálové stránky rsyncu, která má 2500 řádků a jak bývá u manuálových stránek zvykem, u popisu --exclude na to čtenář není upozorněn. Takže se to dozví pouze tehdy, když si manuálovou stránku přečte celou jako román. Proto má uživatel v zásadě na výběr dvě možnosti: buď zemře sešlostí věkem dřív, než ten rsync vůbec pustí, a nebo se rsync bude chovat jinak, než uživatel bude věřit, že by se měl chovat, a uživatel nebude chápat proč.

    Další přepínače si vysvětlíme v příštím dílu seriálu.

           

    Hodnocení: 50 %

            špatnédobré        

    Nástroje: Tisk bez diskuse

    Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

    Komentáře

    Diskuse byla administrátory uzamčena

    23.3.2016 10:15 Nikola Ciprich | skóre: 23 | blog: NiX_blog | Palkovice
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    mno na seriál se těším, i když rozsah prvního dílu mě kapánek zklamal.. :(
    Did you ever touch the starlight ? Dream for a thousand years? Have you ever seen the beauty Of a newborn century?
    23.3.2016 13:05 Marián Kyral | skóre: 29 | blog: Sem_Tam | Frýdek-Místek
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    Tak v příštím díle si probereme další dvě volby a uvaříme si další kafe :-D
    23.3.2016 19:41 n
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    +1
    24.3.2016 06:28 dutá palice
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    Takže raději delší články včetně omáčky a velké přílohy i když už se tam nebude vejít to hlavní?
    24.3.2016 09:43 |🇵🇸 | skóre: 94 | blog:
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    Nebo delší články bez omáčky…?
    🇵🇸Touch grass🇺🇦 ✊ ani boha, ani pána
    23.3.2016 14:33 Michal Kubeček | skóre: 71 | Luštěnice
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    50 tisíc souborů? To je tedy slušné cvičení na souborový systém. Posuďte sami.

    Hm…

    mike@unicorn:~/work/git/kernel-upstream> time du -sm .
    1862    .
    
    real    0m1.698s
    user    0m0.132s
    sys     0m0.944s
    mike@unicorn:~/work/git/kernel-upstream> find . -type f | wc -l
    54299
    
    23.3.2016 17:13 Georgius
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    Tak nevím, co používá autor blogu, ze srandy jsem to zkusil na disku připojeném z NASky gigovou sítí přes NFS (ten find trvá docela dlouho ...) nad adresářem s 10 podadresáři, z nichž v každém bylo 26728 souborů:
    $ time du -sm .
    88245	.
    
    real	3m0.174s
    user	0m0.636s
    sys	0m8.708s
    
    $ find . -type f | wc -l
    257280
    
    Ale fakt je, že ten find trval věky ...
    
    
    
    
    23.3.2016 18:13 Michal Kubeček | skóre: 71 | Luštěnice
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    autor blogu

    Kéž by… on je to ale článek.

    24.3.2016 06:32 dutá palice
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    Nepoužíváš slavné BTRFS?
    24.3.2016 07:22 Michal Kubeček | skóre: 71 | Luštěnice
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    Ne, tohle bylo na ext4 (a pro pořádek, předtím jsem flushnul cache).
    24.3.2016 01:09 František Koudelka
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    Trochu se mi nezdá, že by stihl Korejskou válku, cituji "Založen byl již v roce 1971 Michaelem S. Hartem, americkým veteránem korejské války, který zemřel roku 2011 ve věku 64 let."
    24.3.2016 10:12 miky
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    Njn, co dodat k autorovi zmineneho clanku, ona veta na strankach Gutenberga zni totiz jinak "and served in the Army in Korea during the Vietnam era" ...
    24.3.2016 10:31 Petr Tomášek | skóre: 39 | blog: Vejšplechty
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    Probůh, vybírat literaturu podle počtu archaismů... *FACEPALM*
    multicult.fm | monokultura je zlo | welcome refugees!
    24.3.2016 15:37 Václav "Darm" Novák | skóre: 26 | blog: Darmovy_kecy | Bechyně / Praha
    Rozbalit Rozbalit vše Re: Filtrujme čtivé texty z Projektu Gutenberg 1
    No jestli má problém přeložit i výše zmíněnou větu o minulosti jednoho z autorů, ani se tomu strachu z archaismů nedivím :)
    Cross my heart and hope to fly, stick a cupcake in my eye!
    ISSN 1214-1267   www.czech-server.cz
    © 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.