abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
eParkomat, startup z ČR, postoupil mezi finalisty evropského akcelerátoru ChallengeUp!
Robot na pivo mu otevřel dveře k opravdovému byznysu
Internet věcí: Propojený svět? Už se to blíží...
dnes 17:02 | Pozvánky

Přijďte si popovídat o open source obecně a openSUSE konkrétně s dalšími uživateli a vývojáři. Oslava nového vydání openSUSE Leap se uskuteční 16. prosince od 17:00 v nových prostorách firmy SUSE v Praze. K dispozici bude nějaké občerstvení a DVD pro ty, kdo je sbírají nebo ještě mají mechaniku. Po párty v kanceláři se bude pokračovat v některé z hospod v okolí.

Miška | Komentářů: 1
dnes 14:55 | Zajímavý software

Byla vydána verze Alpha 1.0 otevřeného operačního systému pro chytré hodinky AsteroidOS. Podporovány jsou hodinky LG G Watch, LG G Watch Urbane, Asus ZenWatch 2 a Sony Smartwatch 3. Ukázka ovládání hodinek na YouTube. Jaroslav Řezník přednášel o AsteroidOS na chytrých hodinkách (videozáznam) na letošní konferenci OpenAlt.

Ladislav Hagara | Komentářů: 0
dnes 13:30 | Zajímavý software

Byly uvolněny zdrojové kódy známé rogue-like hry DoomRL. Počátky hry jsou v roce 2002. Je napsána ve FreePascalu a zdrojový kód je nyní k dispozici na GitHubu pod licencí GNU GPL 2.0. Autor pracuje na nové hře Jupiter Hell, která je moderním nástupcem DoomRL a na jejíž vývoj shání peníze prostřednictvím Kickstarteru.

Blaazen | Komentářů: 0
dnes 13:15 | Pozvánky

Přijďte s námi oslavit vydání Fedory 25. Na programu budou přednášky o novinkách, diskuse, neřízený networking atd. Release Party se bude konat 16. prosince v prostorách společnosti Etnetera. Na party budou volně k dispozici také propagační materiály, nová DVD s Fedorou 25 a samozřejmě občerstvení. Přednášky budou probíhat v češtině. Pro více informací se můžete podívat na web MojeFedora.cz. Jen připomínám, že tentokrát jsme zavedli

… více »
frantisekz | Komentářů: 0
včera 16:38 | Komunita

Byly zveřejněny videozáznamy přednášek a workshopů z letošní konference OpenAlt konané 5. a 6. listopadu v Brně. K videozáznamům lze přistupovat ze stránky na SuperLectures nebo přes program konference, detaily o vybrané přednášce nebo workshopu a dále kliknutím na ikonku filmového pásu. Celkově bylo zpracováno 65 hodin z 89 přednášek a workshopů.

Ladislav Hagara | Komentářů: 0
včera 11:30 | Komunita

Bylo oznámeno, že bude proveden bezpečnostní audit zdrojových kódů open source softwaru pro implementaci virtuálních privátních sítí OpenVPN. Audit provede Matthew D. Green (blog), uznávaný kryptolog a profesor na Univerzitě Johnse Hopkinse. Auditována bude verze 2.4 (aktuálně RC 1, stabilní verze je 2.3.14). Audit bude financován společností Private Internet Access [reddit].

Ladislav Hagara | Komentářů: 4
včera 06:00 | Komunita

Na YouTube byl publikován Blender Institute Reel 2016, ani ne dvouminutový sestřih z filmů, které vznikly za posledních 10 let díky Blender Institutu. V institutu aktuálně pracují na novém filmu Agent 327. Dění kolem filmu lze sledovat na Blender Cloudu. Videoukázka Agenta 327 z června letošního roku na YouTube.

Ladislav Hagara | Komentářů: 0
včera 01:02 | Zajímavý článek

Minulý týden byly vydány verze 1.2.3 a 1.1.7 webového poštovního klienta Roundcube. V oznámení o vydání bylo zmíněno řešení bezpečnostního problému nalezeného společností RIPS a souvisejícího s voláním funkce mail() v PHP. Tento týden byly zveřejněny podrobnosti. Útočník mohl pomocí speciálně připraveného emailu spustit na serveru libovolný příkaz. Stejně, jak je popsáno v článku Exploit PHP’s mail() to get remote code execution z roku 2014.

Ladislav Hagara | Komentářů: 1
8.12. 16:00 | Nová verze

Byla vydána verze 0.98 svobodného nelineárního video editoru Pitivi. Z novinek lze zmínit například přizpůsobitelné klávesové zkratky. Videoukázka práce s nejnovější verzí Pitivi na YouTube.

Ladislav Hagara | Komentářů: 1
8.12. 15:00 | Zajímavý software

Stop motion je technika animace, při níž je reálný objekt mezi jednotlivými snímky ručně upravován a posouván o malé úseky, tak aby po spojení vyvolala animace dojem spojitosti. Jaký software lze pro stop motion použít na Linuxu? Článek na OMG! Ubuntu! představuje Heron Animation. Ten bohužel podporuje pouze webové kamery. Podpora digitálních zrcadlovek je začleněna například v programu qStopMotion.

Ladislav Hagara | Komentářů: 5
Kolik máte dat ve svém domovském adresáři na svém primárním osobním počítači?
 (32%)
 (24%)
 (29%)
 (7%)
 (5%)
 (3%)
Celkem 808 hlasů
 Komentářů: 50, poslední 29.11. 15:50
Rozcestník
Reklama

Dotaz: Parsovani HTML pomoci regularnich vyrazu

Bundas avatar 20.9.2014 18:17 Bundas | skóre: 14 | Pardubice
Parsovani HTML pomoci regularnich vyrazu
Přečteno: 347×

Ahojte vsichni.

Mam nekolik odkazu:
<a href="/dafuq/lol/1/">1</a>
<a href="/dafuq/lol/2/">2</a>
<a href="/dafuq/lol/3/">3</a>
<a href="/dafuq/lol/4/">...</a>
<a href="/dafuq/lol/8/">8</a>
<a href="/dafuq/lol/9/">9</a>

Potrebuju z nich dostat tu cislovku na konci odkazu (napr. <a href="/dafuq/lol/9/">9</a>) pomoci regularniho vyrazu. Jak to mam udelat? Regexy mi vubec, vubec nejdou. Predem diky za pomoc

Abe the Messiah has come.

Řešení dotazu:


Odpovědi

Řešení 1× (Bundas (tazatel))
Bundas avatar 20.9.2014 18:30 Bundas | skóre: 14 | Pardubice
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Uz jsem to vyresil

 

<a href="/dafuq/[^/]*/([^/\"]*)/">[^<>/]*</a>

Abe the Messiah has come.
20.9.2014 19:21 Kit | skóre: 37 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Zkus ještě utilitu xmllint. Ta umí parsovat HTML o něco lépe.
Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
20.9.2014 19:58 Kit | skóre: 37 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Místo regexpu se dá použít také XQuery:
for $x in doc("input.html")//a
    return substring-before(substring-after($x/@href, 'lol/'), '/')
Možná to nevypadá tak elegantně jako regexp, ale poradí si to i s více odkazy na řádku, zalomenými atributy, komentáři...
Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
Jakub Lucký avatar 20.9.2014 23:36 Jakub Lucký | skóre: 40 | Praha
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
If you understand, things are just as they are; if you do not understand, things are just as they are. (Zen P.) Blogísek
Josef Kufner avatar 21.9.2014 01:01 Josef Kufner | skóre: 66
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
lynx -dump -listonly -nonumbers http://abclinuxu.cz/
Na vytáhnutí odkazů z HTML to je velice praktické. Pak už ty regulární výrazy lze použít snadno.
Hello world ! Segmentation fault (core dumped)
21.9.2014 08:09 Kit | skóre: 37 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Paráda. Lynx používám, ale o této volbě jsem netušil. Díky.
Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
Fuky avatar 21.9.2014 09:07 Fuky | skóre: 52 | blog: 4u
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Na parsování HTML bych doporučil nástroje k tomu určené a ne regulární výrazy.

$ vim get_a_href.py
#! /usr/bin/env python
# -*- coding: utf-8 -*-

import sys
from lxml.html import parse

if (len(sys.argv) != 2):
    print "Usage: %s FILENAME or URL" % sys.argv[0]
    sys.exit()

page = parse(sys.argv[1])
urls = page.xpath('//a/@href')

for url in urls:
    print url
$ chmod +x get_a_href.py
21.9.2014 15:04 Petr | skóre: 29
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Jeste bych se pripojil ke kolegovi, mam podobny dotaz ale ohledne parsovani XML - pro obcasne potreby pouzivam reg. vyrazy, je nejaky silnejsi nastroj v linuxu pod licenci GNU?
Fuky avatar 21.9.2014 15:09 Fuky | skóre: 52 | blog: 4u
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
21.9.2014 15:29 Kit | skóre: 37 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
xmllint, xmlstarlet, xqilla, xsltproc, xmlto,...
Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
Josef Kufner avatar 21.9.2014 15:31 Josef Kufner | skóre: 66
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Je, ale těžko se hledají. Ono většinou se s XML pracuje z větších programů prostřednictvím knihoven a pro příkazový řádek toho moc není.

Zkus: xpath, xmllint, xsltproc

Například z XML v dotazu:
<html>
<a href="/dafuq/lol/1/">1</a>
<a href="/dafuq/lol/2/">2</a>
<a href="/dafuq/lol/3/">3</a>
<a href="/dafuq/lol/4/">4</a>
<a href="/dafuq/lol/5/">5</a>
<a href="/dafuq/lol/6/">6</a>
<a href="/dafuq/lol/7/">7</a>
<a href="/dafuq/lol/8/">8</a>
<a href="/dafuq/lol/9/">9</a>
</html>
Lze všechny URL získat takto:
xpath -q -e '//a/@href' soubor.xml
Výsledek:
 href="/dafuq/lol/1/"
 href="/dafuq/lol/2/"
 href="/dafuq/lol/3/"
 href="/dafuq/lol/4/"
 href="/dafuq/lol/5/"
 href="/dafuq/lol/6/"
 href="/dafuq/lol/7/"
 href="/dafuq/lol/8/"
 href="/dafuq/lol/9/"
Hello world ! Segmentation fault (core dumped)
21.9.2014 15:53 Kit | skóre: 37 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Teď koukám na xpath. Dalo by se z toho dostat např.
/dafuq/lol/1/
/dafuq/lol/2/
/dafuq/lol/3/
/dafuq/lol/4/
/dafuq/lol/8/
/dafuq/lol/9/
nebo
1, 2, 3, 4, 8, 9
jinak než sedem? Obvykle používám xsltproc, což je na některé drobnosti zbytečně těžký kalibr. Na jednodušší věci momentálně používám program xqilla, ale úplně mi nesedí.
Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
21.9.2014 16:17 Kit | skóre: 37 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Tak už jsem na to přišel sám. Stačí v tom perlovém skriptu xpath vyměnit volání metody toString za getNodeValue a případně dál upravit dle potřeby.
Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
Josef Kufner avatar 21.9.2014 17:35 Josef Kufner | skóre: 66
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Nechceš to dát jako volbu a poslat autorům patch?
Hello world ! Segmentation fault (core dumped)
21.9.2014 17:56 Kit | skóre: 37 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
To není špatný nápad. Celý ten skript má jen 200 řádek, dá se to v něm snadno najít, ale přidání další volby pro mne není úplně triviální, protože v Perlu moc nedělám.

Asi bych to musel nejprve trochu refaktorovat, aby se to tam dalo přidat jako volba. Otázkou je, zda má smysl se tím zabývat, protože podobných utilit je (jak vidno) hromada.
Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
Josef Kufner avatar 21.9.2014 18:36 Josef Kufner | skóre: 66
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Tak aspoň pošli feature request s diffem, třeba to doplní. Ono těch snadno použitelných nástrojů zas tak moc není.
Hello world ! Segmentation fault (core dumped)
21.9.2014 19:14 Kit | skóre: 37 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Nerad dodělávám další vlastnosti. Raději odstraňuji ty, které považuji za zbytečné. Po odstranění zbytečných řádek zbylo z původních 205 jen 10.

Máme kolem sebe tolik univerzálně použitelných nástrojů, až se mi někdy jeví jako univerzálně nepoužitelné. Redukce je občas nezbytná.
Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
21.9.2014 19:07 Kit | skóre: 37 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu
Tak místo odpovědi autorům jsem ten skript trochu zkrátil a posílám ho sem:
#!/usr/bin/perl -w

use XML::XPath;
$xpath = XML::XPath->new(ioref => \*STDIN);
my $names = $xpath->find('//a/@href');
for my $node ($names->get_nodelist) {
    $_ = $node->getNodeValue;
    s|^.*/([^/]*)/$|$1|;
    print $_, "\n";
}
A to je celé. Volby jsou pryč, vstupem je STDIN. Dělá to jen to, co chce tazatel, ale přímo z HTML.
Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

Založit nové vláknoNahoru

Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

ISSN 1214-1267   www.czech-server.cz
© 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.