abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
eParkomat, startup z ČR, postoupil mezi finalisty evropského akcelerátoru ChallengeUp!
Robot na pivo mu otevřel dveře k opravdovému byznysu
Internet věcí: Propojený svět? Už se to blíží...
včera 16:38 | Komunita

Byly zveřejněny videozáznamy přednášek a workshopů z letošní konference OpenAlt konané 5. a 6. listopadu v Brně. K videozáznamům lze přistupovat ze stránky na SuperLectures nebo přes program konference, detaily o vybrané přednášce nebo workshopu a dále kliknutím na ikonku filmového pásu. Celkově bylo zpracováno 65 hodin z 89 přednášek a workshopů.

Ladislav Hagara | Komentářů: 0
včera 11:30 | Komunita

Bylo oznámeno, že bude proveden bezpečnostní audit zdrojových kódů open source softwaru pro implementaci virtuálních privátních sítí OpenVPN. Audit provede Matthew D. Green (blog), uznávaný kryptolog a profesor na Univerzitě Johnse Hopkinse. Auditována bude verze 2.4 (aktuálně RC 1, stabilní verze je 2.3.14). Audit bude financován společností Private Internet Access [reddit].

Ladislav Hagara | Komentářů: 2
včera 06:00 | Komunita

Na YouTube byl publikován Blender Institute Reel 2016, ani ne dvouminutový sestřih z filmů, které vznikly za posledních 10 let díky Blender Institutu. V institutu aktuálně pracují na novém filmu Agent 327. Dění kolem filmu lze sledovat na Blender Cloudu. Videoukázka Agenta 327 z června letošního roku na YouTube.

Ladislav Hagara | Komentářů: 0
včera 01:02 | Zajímavý článek

Minulý týden byly vydány verze 1.2.3 a 1.1.7 webového poštovního klienta Roundcube. V oznámení o vydání bylo zmíněno řešení bezpečnostního problému nalezeného společností RIPS a souvisejícího s voláním funkce mail() v PHP. Tento týden byly zveřejněny podrobnosti. Útočník mohl pomocí speciálně připraveného emailu spustit na serveru libovolný příkaz. Stejně, jak je popsáno v článku Exploit PHP’s mail() to get remote code execution z roku 2014.

Ladislav Hagara | Komentářů: 1
8.12. 16:00 | Nová verze

Byla vydána verze 0.98 svobodného nelineárního video editoru Pitivi. Z novinek lze zmínit například přizpůsobitelné klávesové zkratky. Videoukázka práce s nejnovější verzí Pitivi na YouTube.

Ladislav Hagara | Komentářů: 1
8.12. 15:00 | Zajímavý software

Stop motion je technika animace, při níž je reálný objekt mezi jednotlivými snímky ručně upravován a posouván o malé úseky, tak aby po spojení vyvolala animace dojem spojitosti. Jaký software lze pro stop motion použít na Linuxu? Článek na OMG! Ubuntu! představuje Heron Animation. Ten bohužel podporuje pouze webové kamery. Podpora digitálních zrcadlovek je začleněna například v programu qStopMotion.

Ladislav Hagara | Komentářů: 5
7.12. 21:21 | Nová verze Ladislav Hagara | Komentářů: 0
7.12. 11:44 | Zajímavý projekt

Na Indiegogo byla spuštěna kampaň na podporu herní mini konzole a multimediálního centra RetroEngine Sigma od Doyodo. Předobjednat ji lze již od 49 dolarů. Požadovaná částka 20 000 dolarů byla překonána již 6 krát. Majitelé mini konzole si budou moci zahrát hry pro Atari VCS 2600, Sega Genesis nebo NES. Předinstalováno bude multimediální centrum Kodi.

Ladislav Hagara | Komentářů: 2
7.12. 00:10 | Nová verze

Byla vydána verze 4.7 redakčního systému WordPress. Kódové označením Vaughan bylo vybráno na počest americké jazzové zpěvačky Sarah "Sassy" Vaughan. Z novinek lze zmínit například novou výchozí šablonu Twenty Seventeen, náhledy pdf souborů nebo WordPress REST API.

Ladislav Hagara | Komentářů: 10
6.12. 12:00 | Zajímavý projekt

Projekt Termbox umožňuje vyzkoušet si linuxové distribuce Ubuntu, Debian, Fedora, CentOS a Arch Linux ve webovém prohlížeči. Řešení je postaveno na projektu HyperContainer. Podrobnosti v často kladených dotazech (FAQ). Zdrojové kódy jsou k dispozici na GitHubu [reddit].

Ladislav Hagara | Komentářů: 28
Kolik máte dat ve svém domovském adresáři na svém primárním osobním počítači?
 (32%)
 (24%)
 (29%)
 (7%)
 (5%)
 (3%)
Celkem 808 hlasů
 Komentářů: 50, poslední 29.11. 15:50
Rozcestník
Reklama

Dotaz: perl - vypreparovani textu z html

11.12.2007 01:53 motorcb | skóre: 12
perl - vypreparovani textu z html
Přečteno: 577×
Zdravim. Chtel bych se zeptat jestli je pomoci perlu mozne vypreparovat pouze text z html stranky... Nemate nekdo takovy script?

Odpovědi

11.12.2007 05:35 Michal Čihař | skóre: 61 | blog: Bláboly | Praha
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Po zadání do Googlu mi jako první výsledek vypadl modul HTML::FormatText, zkoušel si ho?
11.12.2007 07:51 happy barney | skóre: 34 | blog: dont_worry_be_happy
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
- s/<[^>]+>//gs
- HTML::Parser
- HTML::Tree
11.12.2007 11:19 motorcb | skóre: 12
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Take nevim jak se na to mam Google zeptat :( Protoze to sotva dokazu popsat 2 vetama cesky :) V tom je taky velky problem :(
11.12.2007 11:36 ams
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Kdyz jde o Perl, prvni misto kde je vhodne zacit hledat je CPAN. Kdyz tam zadate napr. "html extract text" tak dostanete jako prvni odkaz modul File::Extract::HTML. Pak uz staci
use File::Extract::HTML;
print File::Extract::HTML::extract("soubor.html");
11.12.2007 12:37 motorcb | skóre: 12
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
#!/usr/bin/perl
use File::Extract::HTML;
print File::Extract::HTML::extract("pokus.html");
Hlasi:
delli:~/perl# ./htmlparser.pl
Can't locate File/Extract/HTML.pm in @INC (@INC contains: /etc/perl /usr/local/lib/perl/5.8.8 /usr/local/share/perl/5.8.8 /usr/lib/perl5 /usr/share/perl5 /usr/lib/perl/5.8 /usr/share/perl/5.8 /usr/local/lib/site_perl .) at ./htmlparser.pl line 3.
BEGIN failed--compilation aborted at ./htmlparser.pl line 3.
11.12.2007 12:39 myšák | skóre: 26 | blog: EmentuX | Ostrava
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html

No ale když ten modul nemáte (velmi pravděpodobně) nainstalovaný, tak ho asi těžko můžete použít...

Je nesmírně těžké být idiotem, konkurence je obrovská...
11.12.2007 12:44 motorcb | skóre: 12
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Ano, s nejvetsi pravdepodobnosti ho nemam nainstalovany. Jak se prosim nainstaluje? Diky
Marek Stopka avatar 11.12.2007 12:57 Marek Stopka | skóre: 57 | blog: Paranoidní blog | London, United Kingdom
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Marek Stopka avatar 11.12.2007 12:59 Marek Stopka | skóre: 57 | blog: Paranoidní blog | London, United Kingdom
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Mohlo by stačit nakopírovat někam tenhle soubor, pokud na tento modul nemáte balíček. Ale kam ho nakopírovat IMHO záleží na distribuci.
11.12.2007 13:05 happy barney | skóre: 34 | blog: dont_worry_be_happy
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
perl -MCPAN -e 'install File::Extract::HTML'
11.12.2007 13:39 motorcb | skóre: 12
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Distribuce Debian
delli:~# perl -MCPAN -e 'install File::Extract::HTML'
CPAN: Storable loaded ok
Going to read /root/.cpan/Metadata
  Database was generated on Tue, 11 Dec 2007 00:37:43 GMT
File::Extract::HTML is up to date.
delli:~# mc
delli:~/perl# ./htmlparser.pl
Can't locate object method "mime_type" via package "test.html" (perhaps you forgot to load "test.html"?) at /usr/local/share/perl/5.8.8/File/Extract/HTML.pm line 25.
11.12.2007 13:52 outsider
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Manualova stranka nefunguje? Sice vim, co je spatne, ale kdyz vidim tak malo snahy... se mi skoro nechce ani radit...
11.12.2007 13:56 motorcb | skóre: 12
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Opravdu nevim pod cim by se to nechalo najit :(
11.12.2007 14:09 outsider
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Prekvapive

man File::Extract::HTML

a

man File::Extract

a

man File::Extract::Result
11.12.2007 13:55 outsider
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Asi takhle by to mohlo fungovat (ale nemam vyzkouseno):
use File::Extract::HTML;
my $e = File::Extract::HTML->new();
my $r = $e->extract($filename);
print $r->text;
11.12.2007 14:23 motorcb | skóre: 12
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Funguje to super,ale neslo by to jeste poupravit aby to davalo mezery mezi to co bylo v tagach? ted to dela toto:

kdyz mam nekolik odkazu za sebou v li,tak ty odkazy tocpe hned za sebe a je bych mezi ne potreboval mezery.HOMEAKTUALITYNOVINKY a ja bych mezi ty tagy potreboval dat mezeru HOME AKTUALITY NOVINKY Jinak by to bylo uplne dokonaly :) Nevedel by nekdo jak na to?
12.12.2007 13:01 mlz
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Nesystemové: s/<LI>/  c; /gi Nejsem si jist, umí-li FILE::EXTRACT entity

Systemově HTML::Parser, který dokáže definovat, co s jednotlivými tokeny/tagy
22.12.2007 23:20 motorcb | skóre: 12
Rozbalit Rozbalit vše Re: perl - vypreparovani textu z html
Ukázková html stránka:

<html>

<head>
<meta http-equiv="Content-Type" content="text/html; charset=UTF-8">
<title>Jednoduchá www stránkalt;/title>
</head>

<body>

<p>Ví­tejte na mé jednoduché www stránce</p>

Menu:
<ul>
<li>Home</li>
<li>Aktuality</li>
<li>Ostatnbí</li>
<li>Položka</li>
</ul<

Tabulka:
<table>
<tr>
<td width="25%">řádek1</td>
<td width="25%">sloupec1</td>
<td width="25%">sloupec2</td>
<td width="25%">sloupec3</td>
</tr>
<tr>
<td width="25%">řádek2</td>
<td width="25%">sloupec1</td>
<td width="25%">sloupec2</td>
<td width="25%">sloupec3</td>
</tr>
<tr>
<td width="25%">řádek3</td>
<td width="25%">sloupec1</td>
<td width="25%">sloupec2</td>
<td width="25%">loupec3</td>
</tr>
</table>

</body>
</html>
Na kterou byl poslan tento script:

#!/usr/bin/perl
#use File::Extract::HTML;
#print File::Extract::HTML::extract("test.html");
open(SOUBOR, ">soubor.txt");
use File::Extract::HTML;
my $e = File::Extract::HTML->new();
my $r = $e->extract("test.html");
print SOUBOR $r->text;
close(SOUBOR);


Vyplivne:

Jednoduchá www stránkaVítejte na mé jednoduché www stránce Menu: HomeAktualityOstatnbíPoložka Tabulka: řádek1sloupec1sloupec2sloupec3řádek2sloupec1sloupec2sloupec3řádek3sloupec1sloupec2sloupec3

A ja bych potreboval aby byli mezi jednotlivyma polozkama mezery: Jednoduchá www stránka Vítejte na mé jednoduché www stránce Menu: Home Aktuality Ostatnbí Položka Tabulka: řádek1 sloupec1 sloupec2 sloupec3 řádek2 sloupec1 sloupec2 sloupec3 řádek3 sloupec1 sloupec2 sloupec3
Nevedel by nekdo? Predem kekuji :)

Založit nové vláknoNahoru

Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

ISSN 1214-1267   www.czech-server.cz
© 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.