Parsovani HTML pomoci regularnich vyrazu (vyřešeno)

Jeste bych se pripojil ke kolegovi, mam podobny dotaz ale ohledne parsovani XML - pro obcasne potreby pouzivam reg. vyrazy, je nejaky silnejsi nastroj v linuxu pod licenci GNU?

21.9.2014 15:09 Fuky | skóre: 52 | blog: 4u
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

lxml - XML and HTML with Python

-- RÁMO: psí tábor , ETriatlon: Výuka plavání

21.9.2014 15:29 Kit | skóre: 46 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

xmllint, xmlstarlet, xqilla, xsltproc, xmlto,...

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 15:31 Josef Kufner | skóre: 70
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Je, ale těžko se hledají. Ono většinou se s XML pracuje z větších programů prostřednictvím knihoven a pro příkazový řádek toho moc není.

Zkus: xpath, xmllint, xsltproc

Například z XML v dotazu:

<html>
<a href="/dafuq/lol/1/">1</a>
<a href="/dafuq/lol/2/">2</a>
<a href="/dafuq/lol/3/">3</a>
<a href="/dafuq/lol/4/">4</a>
<a href="/dafuq/lol/5/">5</a>
<a href="/dafuq/lol/6/">6</a>
<a href="/dafuq/lol/7/">7</a>
<a href="/dafuq/lol/8/">8</a>
<a href="/dafuq/lol/9/">9</a>
</html>

Lze všechny URL získat takto:

xpath -q -e '//a/@href' soubor.xml

Výsledek:

 href="/dafuq/lol/1/"
 href="/dafuq/lol/2/"
 href="/dafuq/lol/3/"
 href="/dafuq/lol/4/"
 href="/dafuq/lol/5/"
 href="/dafuq/lol/6/"
 href="/dafuq/lol/7/"
 href="/dafuq/lol/8/"
 href="/dafuq/lol/9/"

Hello world ! Segmentation fault (core dumped)

21.9.2014 15:53 Kit | skóre: 46 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Teď koukám na xpath. Dalo by se z toho dostat např.

/dafuq/lol/1/
/dafuq/lol/2/
/dafuq/lol/3/
/dafuq/lol/4/
/dafuq/lol/8/
/dafuq/lol/9/

nebo

1, 2, 3, 4, 8, 9

jinak než sedem? Obvykle používám xsltproc, což je na některé drobnosti zbytečně těžký kalibr. Na jednodušší věci momentálně používám program xqilla, ale úplně mi nesedí.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 16:17 Kit | skóre: 46 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Tak už jsem na to přišel sám. Stačí v tom perlovém skriptu xpath vyměnit volání metody toString za getNodeValue a případně dál upravit dle potřeby.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 17:35 Josef Kufner | skóre: 70
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Nechceš to dát jako volbu a poslat autorům patch?

Hello world ! Segmentation fault (core dumped)

21.9.2014 17:56 Kit | skóre: 46 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

To není špatný nápad. Celý ten skript má jen 200 řádek, dá se to v něm snadno najít, ale přidání další volby pro mne není úplně triviální, protože v Perlu moc nedělám.

Asi bych to musel nejprve trochu refaktorovat, aby se to tam dalo přidat jako volba. Otázkou je, zda má smysl se tím zabývat, protože podobných utilit je (jak vidno) hromada.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 18:36 Josef Kufner | skóre: 70
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Tak aspoň pošli feature request s diffem, třeba to doplní. Ono těch snadno použitelných nástrojů zas tak moc není.

Hello world ! Segmentation fault (core dumped)

21.9.2014 19:14 Kit | skóre: 46 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Nerad dodělávám další vlastnosti. Raději odstraňuji ty, které považuji za zbytečné. Po odstranění zbytečných řádek zbylo z původních 205 jen 10.

Máme kolem sebe tolik univerzálně použitelných nástrojů, až se mi někdy jeví jako univerzálně nepoužitelné. Redukce je občas nezbytná.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 19:07 Kit | skóre: 46 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Tak místo odpovědi autorům jsem ten skript trochu zkrátil a posílám ho sem:

#!/usr/bin/perl -w

use XML::XPath;
$xpath = XML::XPath->new(ioref => \*STDIN);
my $names = $xpath->find('//a/@href');
for my $node ($names->get_nodelist) {
    $_ = $node->getNodeValue;
    s|^.*/([^/]*)/$|$1|;
    print $_, "\n";
}

A to je celé. Volby jsou pryč, vstupem je STDIN. Dělá to jen to, co chce tazatel, ale přímo z HTML.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

Dotaz: Parsovani HTML pomoci regularnich vyrazu

Odpovědi