abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
    dnes 03:33 | Zajímavý software

    AI Claude Code od Anthropicu lépe rozumí frameworku Nette, tj. open source frameworku pro tvorbu webových aplikací v PHP. David Grudl napsal plugin Nette pro Claude Code.

    Ladislav Hagara | Komentářů: 0
    dnes 00:11 | Nová verze

    Byla vydána prosincová aktualizace aneb nová verze 1.108 editoru zdrojových kódů Visual Studio Code (Wikipedie). Přehled novinek i s náhledy a videi v poznámkách k vydání. Ve verzi 1.108 vyjde také VSCodium, tj. komunitní sestavení Visual Studia Code bez telemetrie a licenčních podmínek Microsoftu.

    Ladislav Hagara | Komentářů: 0
    včera 20:44 | IT novinky

    Na lasvegaském veletrhu elektroniky CES byl předveden prototyp notebooku chlazeného pomocí plazmových aktuátorů (DBD). Ačkoliv se nejedná o první nápad svého druhu, nepochybně to je první ukázka praktického použití tohoto způsobu chlazení v běžné elektronice. Co činí plazmové chladící akční členy technologickou výzvou je především vysoká produkce jedovatého ozonu, tu se prý podařilo firmě YPlasma zredukovat dielektrickou

    … více »
    NUKE GAZA! 🎆 | Komentářů: 4
    včera 16:33 | Zajímavý projekt

    Patchouli je open source implementace EMR grafického tabletu (polohovací zařízení). Projekt je hostován na GitLabu.

    Ladislav Hagara | Komentářů: 0
    včera 14:11 | IT novinky

    Český Nejvyšší soud potvrdil, že česká právní úprava plošného uchování dat o elektronické komunikaci porušuje právo Evropské unie. Pravomocným rozsudkem zamítl dovolání ministerstva průmyslu a obchodu. To se teď musí omluvit novináři Českého rozhlasu Janu Cibulkovi za zásah do práv na ochranu soukromí a osobních údajů. Ve sporu jde o povinnost provozovatelů sítí uchovávat údaje, ze kterých lze odvodit, kdo, s kým a odkud komunikoval.

    Ladislav Hagara | Komentářů: 6
    včera 02:11 | Komunita

    Google bude vydávat zdrojové kódy Androidu pouze dvakrát ročně. Ve 2. a 4. čtvrtletí.

    Ladislav Hagara | Komentářů: 0
    7.1. 17:22 | Zajímavý článek

    Bezpečnostní specialista Graham Helton z Low Orbit Security si všímá podezřelých anomálií v BGP, zaznamenaných krátce před vstupem ozbrojených sil USA na území Venezuely, které tam během bleskové speciální vojenské operace úspěšně zatkly venezuelského diktátora Madura za narkoterorismus. BGP (Border Gateway Protocol) je 'dynamický směrovací protokol, který umožňuje routerům automaticky reagovat na změny topologie počítačové sítě' a je v bezpečnostních kruzích znám jako 'notoricky nezabezpečený'.

    NUKE GAZA! 🎆 | Komentářů: 9
    7.1. 06:11 | Nová verze

    Společnost Valve aktualizovala přehled o hardwarovém a softwarovém vybavení uživatelů služby Steam. Podíl uživatelů Linuxu dosáhl 3,58 %. Nejčastěji používané linuxové distribuce jsou Arch Linux, Linux Mint a Ubuntu. Při výběru jenom Linuxu vede SteamOS Holo s 26,32 %. Procesor AMD používá 67,43 % hráčů na Linuxu.

    Ladislav Hagara | Komentářů: 4
    7.1. 05:55 | IT novinky

    V Las Vegas probíhá veletrh CES (Consumer Electronics Show, Wikipedie). Firmy představují své novinky. Například LEGO představilo systém LEGO SMART Play: chytré kostky SMART Brick, dlaždičky SMART Tagy a SMART minifigurky. Kostka SMART Brick dokáže rozpoznat přítomnost SMART Tagů a SMART minifigurek, které se nacházejí v její blízkosti. Ty kostku SMART Brick aktivují a určí, co má dělat.

    Ladislav Hagara | Komentářů: 0
    6.1. 18:33 | Bezpečnostní upozornění

    Vládní CERT (GovCERT.CZ) upozorňuje (𝕏) na kritickou zranitelnost v jsPDF, CVE-2025-68428. Tato zranitelnost umožňuje neautentizovaným vzdáleným útočníkům číst libovolné soubory z lokálního souborového systému serveru při použití jsPDF v prostředí Node.js. Problém vzniká kvůli nedostatečné validaci vstupu u cest k souborům předávaných několika metodám jsPDF. Útočník může zneužít tuto chybu k exfiltraci citlivých

    … více »
    Ladislav Hagara | Komentářů: 6
    Které desktopové prostředí na Linuxu používáte?
     (1%)
     (5%)
     (0%)
     (10%)
     (21%)
     (4%)
     (5%)
     (3%)
     (11%)
     (54%)
    Celkem 301 hlasů
     Komentářů: 7, poslední včera 15:35
    Rozcestník

    Dotaz: Parsovani HTML pomoci regularnich vyrazu

    Bundas avatar 20.9.2014 18:17 Bundas | skóre: 14 | Pardubice
    Parsovani HTML pomoci regularnich vyrazu
    Přečteno: 454×

    Ahojte vsichni.

    Mam nekolik odkazu:
    <a href="/dafuq/lol/1/">1</a>
    <a href="/dafuq/lol/2/">2</a>
    <a href="/dafuq/lol/3/">3</a>
    <a href="/dafuq/lol/4/">...</a>
    <a href="/dafuq/lol/8/">8</a>
    <a href="/dafuq/lol/9/">9</a>

    Potrebuju z nich dostat tu cislovku na konci odkazu (napr. <a href="/dafuq/lol/9/">9</a>) pomoci regularniho vyrazu. Jak to mam udelat? Regexy mi vubec, vubec nejdou. Predem diky za pomoc

    Abe the Messiah has come.

    Řešení dotazu:


    Odpovědi

    Řešení 1× (Bundas (tazatel))
    Bundas avatar 20.9.2014 18:30 Bundas | skóre: 14 | Pardubice
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

    Uz jsem to vyresil

     

    <a href="/dafuq/[^/]*/([^/\"]*)/">[^<>/]*</a>

    Abe the Messiah has come.
    20.9.2014 19:21 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Zkus ještě utilitu xmllint. Ta umí parsovat HTML o něco lépe.
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    20.9.2014 19:58 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Místo regexpu se dá použít také XQuery:
    for $x in doc("input.html")//a
        return substring-before(substring-after($x/@href, 'lol/'), '/')
    
    Možná to nevypadá tak elegantně jako regexp, ale poradí si to i s více odkazy na řádku, zalomenými atributy, komentáři...
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    Jakub Lucký avatar 20.9.2014 23:36 Jakub Lucký | skóre: 40 | Praha
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    If you understand, things are just as they are; if you do not understand, things are just as they are.
    Josef Kufner avatar 21.9.2014 01:01 Josef Kufner | skóre: 70
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    lynx -dump -listonly -nonumbers http://abclinuxu.cz/
    Na vytáhnutí odkazů z HTML to je velice praktické. Pak už ty regulární výrazy lze použít snadno.
    Hello world ! Segmentation fault (core dumped)
    21.9.2014 08:09 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Paráda. Lynx používám, ale o této volbě jsem netušil. Díky.
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    Fuky avatar 21.9.2014 09:07 Fuky | skóre: 52 | blog: 4u
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

    Na parsování HTML bych doporučil nástroje k tomu určené a ne regulární výrazy.

    $ vim get_a_href.py
    #! /usr/bin/env python
    # -*- coding: utf-8 -*-
    
    import sys
    from lxml.html import parse
    
    if (len(sys.argv) != 2):
        print "Usage: %s FILENAME or URL" % sys.argv[0]
        sys.exit()
    
    page = parse(sys.argv[1])
    urls = page.xpath('//a/@href')
    
    for url in urls:
        print url
    $ chmod +x get_a_href.py
    
    21.9.2014 15:04 Petr | skóre: 29
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Jeste bych se pripojil ke kolegovi, mam podobny dotaz ale ohledne parsovani XML - pro obcasne potreby pouzivam reg. vyrazy, je nejaky silnejsi nastroj v linuxu pod licenci GNU?
    Fuky avatar 21.9.2014 15:09 Fuky | skóre: 52 | blog: 4u
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    21.9.2014 15:29 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    xmllint, xmlstarlet, xqilla, xsltproc, xmlto,...
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    Josef Kufner avatar 21.9.2014 15:31 Josef Kufner | skóre: 70
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Je, ale těžko se hledají. Ono většinou se s XML pracuje z větších programů prostřednictvím knihoven a pro příkazový řádek toho moc není.

    Zkus: xpath, xmllint, xsltproc

    Například z XML v dotazu:
    <html>
    <a href="/dafuq/lol/1/">1</a>
    <a href="/dafuq/lol/2/">2</a>
    <a href="/dafuq/lol/3/">3</a>
    <a href="/dafuq/lol/4/">4</a>
    <a href="/dafuq/lol/5/">5</a>
    <a href="/dafuq/lol/6/">6</a>
    <a href="/dafuq/lol/7/">7</a>
    <a href="/dafuq/lol/8/">8</a>
    <a href="/dafuq/lol/9/">9</a>
    </html>
    Lze všechny URL získat takto:
    xpath -q -e '//a/@href' soubor.xml
    Výsledek:
     href="/dafuq/lol/1/"
     href="/dafuq/lol/2/"
     href="/dafuq/lol/3/"
     href="/dafuq/lol/4/"
     href="/dafuq/lol/5/"
     href="/dafuq/lol/6/"
     href="/dafuq/lol/7/"
     href="/dafuq/lol/8/"
     href="/dafuq/lol/9/"
    Hello world ! Segmentation fault (core dumped)
    21.9.2014 15:53 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Teď koukám na xpath. Dalo by se z toho dostat např.
    /dafuq/lol/1/
    /dafuq/lol/2/
    /dafuq/lol/3/
    /dafuq/lol/4/
    /dafuq/lol/8/
    /dafuq/lol/9/
    
    nebo
    1, 2, 3, 4, 8, 9
    jinak než sedem? Obvykle používám xsltproc, což je na některé drobnosti zbytečně těžký kalibr. Na jednodušší věci momentálně používám program xqilla, ale úplně mi nesedí.
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    21.9.2014 16:17 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Tak už jsem na to přišel sám. Stačí v tom perlovém skriptu xpath vyměnit volání metody toString za getNodeValue a případně dál upravit dle potřeby.
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    Josef Kufner avatar 21.9.2014 17:35 Josef Kufner | skóre: 70
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Nechceš to dát jako volbu a poslat autorům patch?
    Hello world ! Segmentation fault (core dumped)
    21.9.2014 17:56 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    To není špatný nápad. Celý ten skript má jen 200 řádek, dá se to v něm snadno najít, ale přidání další volby pro mne není úplně triviální, protože v Perlu moc nedělám.

    Asi bych to musel nejprve trochu refaktorovat, aby se to tam dalo přidat jako volba. Otázkou je, zda má smysl se tím zabývat, protože podobných utilit je (jak vidno) hromada.
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    Josef Kufner avatar 21.9.2014 18:36 Josef Kufner | skóre: 70
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Tak aspoň pošli feature request s diffem, třeba to doplní. Ono těch snadno použitelných nástrojů zas tak moc není.
    Hello world ! Segmentation fault (core dumped)
    21.9.2014 19:14 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Nerad dodělávám další vlastnosti. Raději odstraňuji ty, které považuji za zbytečné. Po odstranění zbytečných řádek zbylo z původních 205 jen 10.

    Máme kolem sebe tolik univerzálně použitelných nástrojů, až se mi někdy jeví jako univerzálně nepoužitelné. Redukce je občas nezbytná.
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    21.9.2014 19:07 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
    Tak místo odpovědi autorům jsem ten skript trochu zkrátil a posílám ho sem:
    #!/usr/bin/perl -w
    
    use XML::XPath;
    $xpath = XML::XPath->new(ioref => \*STDIN);
    my $names = $xpath->find('//a/@href');
    for my $node ($names->get_nodelist) {
        $_ = $node->getNodeValue;
        s|^.*/([^/]*)/$|$1|;
        print $_, "\n";
    }
    
    A to je celé. Volby jsou pryč, vstupem je STDIN. Dělá to jen to, co chce tazatel, ale přímo z HTML.
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

    Založit nové vláknoNahoru

    Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

    ISSN 1214-1267   www.czech-server.cz
    © 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.