Přihlášení | Registrace

napište » Zprávičky

inzerujte » Pracovní nabídky

MagPi 140 a HackSpace 77

dnes 04:44 | Nová verze

Nová čísla časopisů od nakladatelství Raspberry Pi: MagPi 140 (pdf) a HackSpace 77 (pdf).

Ladislav Hagara | Komentářů: 0

ESPHome 2024.4.0

dnes 01:00 | Nová verze

ESPHome, tj. open source systém umožňující nastavovat zařízení s čipy ESP (i dalšími) pomocí konfiguračních souborů a připojit je do domácí automatizace, například do Home Assistantu, byl vydán ve verzi 2024.4.0.

Ladislav Hagara | Komentářů: 0

Open Platform for Enterprise AI (OPEA)

včera 22:11 | IT novinky

LF AI & Data Foundation patřící pod Linux Foundation spustila Open Platform for Enterprise AI (OPEA).

Ladislav Hagara | Komentářů: 0

OpenXR 1.1

včera 20:55 | Nová verze

Neziskové průmyslové konsorcium Khronos Group vydalo verzi 1.1 specifikace OpenXR (Wikipedie), tj. standardu specifikujícího přístup k platformám a zařízením pro XR, tj. platformám a zařízením pro AR (rozšířenou realitu) a VR (virtuální realitu). Do základu se z rozšíření dostalo XR_EXT_local_floor. Společnost Collabora implementuje novou verzi specifikace do platformy Monado, tj. open source implementace OpenXR.

Ladislav Hagara | Komentářů: 2

mpv 0.38.0

včera 17:22 | Nová verze

Byla vydána nová verze 0.38.0 multimediálního přehrávače mpv (Wikipedie) vycházejícího z přehrávačů MPlayer a mplayer2. Přehled novinek, změn a oprav na GitHubu. Požadován je FFmpeg 4.4 nebo novější a také libplacebo 6.338.2 nebo novější.

Ladislav Hagara | Komentářů: 12

ClamAV 1.3.1, 1.2.3 a 1.0.6

včera 17:11 | Nová verze

ClamAV (Wikipedie), tj. multiplatformní antivirový engine s otevřeným zdrojovým kódem pro detekci trojských koní, virů, malwaru a dalších škodlivých hrozeb, byl vydán ve verzích 1.3.1, 1.2.3 a 1.0.6. Ve verzi 1.3.1 je mimo jiné řešena bezpečnostní chyba CVE-2024-20380.

Ladislav Hagara | Komentářů: 2

Mobilní aplikace Portál občana je ode dneška oficiálně venku

včera 12:11 | IT novinky

Digitální a informační agentura (DIA) oznámila (PDF, X a Facebook), že mobilní aplikace Portál občana je ode dneška oficiálně venku.

Ladislav Hagara | Komentářů: 9

#HACKUJBRNO 2024

včera 05:11 | Komunita

#HACKUJBRNO 2024, byly zveřejněny výsledky a výstupy hackathonu města Brna nad otevřenými městskými daty, který se konal 13. a 14. dubna 2024.

Ladislav Hagara | Komentářů: 2

Volla Tablet na Kickstarteru

17.4. 17:55 | IT novinky

Společnost Volla Systeme stojící za telefony Volla spustila na Kickstarteru kampaň na podporu tabletu Volla Tablet s Volla OS nebo Ubuntu Touch.

Ladislav Hagara | Komentářů: 3

Robot HD Atlas šel do důchodu. Nastupuje nová vylepšená elektrická varianta

17.4. 17:44 | IT novinky

Společnost Boston Dynamics oznámila, že humanoidní hydraulický robot HD Atlas šel do důchodu (YouTube). Nastupuje nová vylepšená elektrická varianta (YouTube).

Ladislav Hagara | Komentářů: 1

Centrum | Napsat | Starší

navrhněte » Anketa

KDE Plasma 6

už používám (68%)

čekám, až se dostane do mé distibuce (10%)

čekám na pozdější vydání v řadě (2%)

preferuji jiné desktopové prostředí (20%)

Celkem 562 hlasů

Komentářů: 4, poslední 6.4. 15:51

Rozcestník

AbcLinuxu

HDmag.cz

AbcLinuxu:/ Poradna / Programovací poradna / Parsovani HTML pomoci regularnich vyrazu

Štítky: HTML, parsování, pomoc, web

Dotaz: Parsovani HTML pomoci regularnich vyrazu

20.9.2014 18:17 Bundas | skóre: 14 | Pardubice
Parsovani HTML pomoci regularnich vyrazu

Přečteno: 399×

Odpovědět | Admin

Ahojte vsichni.

Mam nekolik odkazu:
<a href="/dafuq/lol/1/">1</a>
<a href="/dafuq/lol/2/">2</a>
<a href="/dafuq/lol/3/">3</a>
<a href="/dafuq/lol/4/">...</a>
<a href="/dafuq/lol/8/">8</a>
<a href="/dafuq/lol/9/">9</a>

Potrebuju z nich dostat tu cislovku na konci odkazu (napr. <a href="/dafuq/lol/9/">9</a>) pomoci regularniho vyrazu. Jak to mam udelat? Regexy mi vubec, vubec nejdou. Predem diky za pomoc

Abe the Messiah has come.

Řešení dotazu:

Komentář #1 (Bundas, 1 hlasů)

Nástroje: Začni sledovat (1) ?

Odpovědi

Řešení 1× (Bundas (tazatel))

20.9.2014 18:30 Bundas | skóre: 14 | Pardubice
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Uz jsem to vyresil

Abe the Messiah has come.

20.9.2014 19:21 Kit | skóre: 45 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Zkus ještě utilitu xmllint. Ta umí parsovat HTML o něco lépe.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

20.9.2014 19:58 Kit | skóre: 45 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Místo regexpu se dá použít také XQuery:

for $x in doc("input.html")//a
    return substring-before(substring-after($x/@href, 'lol/'), '/')

Možná to nevypadá tak elegantně jako regexp, ale poradí si to i s více odkazy na řádku, zalomenými atributy, komentáři...

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

20.9.2014 23:36 Jakub Lucký | skóre: 40 | Praha
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

povinná reference

If you understand, things are just as they are; if you do not understand, things are just as they are.

21.9.2014 01:01 Josef Kufner | skóre: 70
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

lynx -dump -listonly -nonumbers http://abclinuxu.cz/

Na vytáhnutí odkazů z HTML to je velice praktické. Pak už ty regulární výrazy lze použít snadno.

Hello world ! Segmentation fault (core dumped)

21.9.2014 08:09 Kit | skóre: 45 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Paráda. Lynx používám, ale o této volbě jsem netušil. Díky.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 09:07 Fuky | skóre: 52 | blog: 4u
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Na parsování HTML bych doporučil nástroje k tomu určené a ne regulární výrazy.

$ vim get_a_href.py
#! /usr/bin/env python
# -*- coding: utf-8 -*-

import sys
from lxml.html import parse

if (len(sys.argv) != 2):
    print "Usage: %s FILENAME or URL" % sys.argv[0]
    sys.exit()

page = parse(sys.argv[1])
urls = page.xpath('//a/@href')

for url in urls:
    print url
$ chmod +x get_a_href.py

-- RÁMO: psí tábor , ETriatlon: Výuka plavání

21.9.2014 15:04 Petr | skóre: 29
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Jeste bych se pripojil ke kolegovi, mam podobny dotaz ale ohledne parsovani XML - pro obcasne potreby pouzivam reg. vyrazy, je nejaky silnejsi nastroj v linuxu pod licenci GNU?

21.9.2014 15:09 Fuky | skóre: 52 | blog: 4u
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

lxml - XML and HTML with Python

-- RÁMO: psí tábor , ETriatlon: Výuka plavání

21.9.2014 15:29 Kit | skóre: 45 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

xmllint, xmlstarlet, xqilla, xsltproc, xmlto,...

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 15:31 Josef Kufner | skóre: 70
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Je, ale těžko se hledají. Ono většinou se s XML pracuje z větších programů prostřednictvím knihoven a pro příkazový řádek toho moc není.

Zkus: xpath, xmllint, xsltproc

Například z XML v dotazu:

<html>
<a href="/dafuq/lol/1/">1</a>
<a href="/dafuq/lol/2/">2</a>
<a href="/dafuq/lol/3/">3</a>
<a href="/dafuq/lol/4/">4</a>
<a href="/dafuq/lol/5/">5</a>
<a href="/dafuq/lol/6/">6</a>
<a href="/dafuq/lol/7/">7</a>
<a href="/dafuq/lol/8/">8</a>
<a href="/dafuq/lol/9/">9</a>
</html>

Lze všechny URL získat takto:

xpath -q -e '//a/@href' soubor.xml

Výsledek:

 href="/dafuq/lol/1/"
 href="/dafuq/lol/2/"
 href="/dafuq/lol/3/"
 href="/dafuq/lol/4/"
 href="/dafuq/lol/5/"
 href="/dafuq/lol/6/"
 href="/dafuq/lol/7/"
 href="/dafuq/lol/8/"
 href="/dafuq/lol/9/"

Hello world ! Segmentation fault (core dumped)

21.9.2014 15:53 Kit | skóre: 45 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Teď koukám na xpath. Dalo by se z toho dostat např.

/dafuq/lol/1/
/dafuq/lol/2/
/dafuq/lol/3/
/dafuq/lol/4/
/dafuq/lol/8/
/dafuq/lol/9/

nebo

1, 2, 3, 4, 8, 9

jinak než sedem? Obvykle používám xsltproc, což je na některé drobnosti zbytečně těžký kalibr. Na jednodušší věci momentálně používám program xqilla, ale úplně mi nesedí.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 16:17 Kit | skóre: 45 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Tak už jsem na to přišel sám. Stačí v tom perlovém skriptu xpath vyměnit volání metody toString za getNodeValue a případně dál upravit dle potřeby.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 17:35 Josef Kufner | skóre: 70
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Nechceš to dát jako volbu a poslat autorům patch?

Hello world ! Segmentation fault (core dumped)

21.9.2014 17:56 Kit | skóre: 45 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

To není špatný nápad. Celý ten skript má jen 200 řádek, dá se to v něm snadno najít, ale přidání další volby pro mne není úplně triviální, protože v Perlu moc nedělám.

Asi bych to musel nejprve trochu refaktorovat, aby se to tam dalo přidat jako volba. Otázkou je, zda má smysl se tím zabývat, protože podobných utilit je (jak vidno) hromada.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 18:36 Josef Kufner | skóre: 70
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Tak aspoň pošli feature request s diffem, třeba to doplní. Ono těch snadno použitelných nástrojů zas tak moc není.

Hello world ! Segmentation fault (core dumped)

21.9.2014 19:14 Kit | skóre: 45 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Nerad dodělávám další vlastnosti. Raději odstraňuji ty, které považuji za zbytečné. Po odstranění zbytečných řádek zbylo z původních 205 jen 10.

Máme kolem sebe tolik univerzálně použitelných nástrojů, až se mi někdy jeví jako univerzálně nepoužitelné. Redukce je občas nezbytná.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

21.9.2014 19:07 Kit | skóre: 45 | Brno
Rozbalit Rozbalit vše Re: Parsovani HTML pomoci regularnich vyrazu

Tak místo odpovědi autorům jsem ten skript trochu zkrátil a posílám ho sem:

#!/usr/bin/perl -w

use XML::XPath;
$xpath = XML::XPath->new(ioref => \*STDIN);
my $names = $xpath->find('//a/@href');
for my $node ($names->get_nodelist) {
    $_ = $node->getNodeValue;
    s|^.*/([^/]*)/$|$1|;
    print $_, "\n";
}

A to je celé. Volby jsou pryč, vstupem je STDIN. Dělá to jen to, co chce tazatel, ale přímo z HTML.

Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.

Založit nové vlákno • Nahoru

Tiskni Sdílej:

Píšeme jinde

ISSN 1214-1267 www.czech-server.cz

Redakce | Inzerce | Podmínky použití | Osobní údaje