abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
    včera 21:44 | Nová verze

    Weston, referenční implementace kompozitoru pro Wayland, byl vydán ve verzi 15.0.0. Přehled novinek v příspěvku na blogu společnosti Collabora. Vypíchnout lze Lua shell umožňující psát správu oken v jazyce Lua.

    Ladislav Hagara | Komentářů: 0
    včera 21:11 | Nová verze

    Organizace Apache Software Foundation (ASF) vydala verzi 29 integrovaného vývojového prostředí a vývojové platformy napsané v Javě NetBeans (Wikipedie). Přehled novinek na GitHubu. Instalovat lze také ze Snapcraftu a Flathubu.

    Ladislav Hagara | Komentářů: 3
    včera 18:22 | IT novinky

    Ústavní soud na svých webových stránkách i v databázi NALUS (NÁLezy a USnesení Ústavního soudu) představil novou verzi chatbota využívajícího umělou inteligenci. Jeho posláním je usnadnit veřejnosti orientaci v rozsáhlé judikatuře Ústavního soudu a pomoci jí s vyhledáváním informací i na webových stránkách soudu, a to i v jiných jazycích. Jde o první nasazení umělé inteligence v rámci webových stránek a databází judikatury českých soudů.

    Ladislav Hagara | Komentářů: 12
    včera 13:00 | Nová verze

    Byla vydána nová verze 10.1 z Debianu vycházející linuxové distribuce DietPi pro (nejenom) jednodeskové počítače. Přehled novinek v poznámkách k vydání. Vypíchnuta je podpora NanoPi Zero2 a balíček WhoDB.

    Ladislav Hagara | Komentářů: 0
    včera 12:44 | Komunita

    Konference Otvorený softvér vo vzdelávaní, výskume a v IT riešeniach OSSConf 2026 proběhne od 1. do 3. července 2026 na Žilinské univerzita v Žilině: "Cieľom našej konferencie je poskytnúť priestor pre informovanie o novinkách vo vývoji otvoreného softvéru a otvorených technológií, o možnostiach využitia týchto nástrojov vo vede a vzdelávaní a taktiež poskytnúť priestor pre neformálne priateľské stretnutie užívateľov a priaznivcov

    … více »
    Ladislav Hagara | Komentářů: 0
    včera 12:22 | Pozvánky

    Korespondenční seminář z programování (KSP) pražského Matfyzu pořádá i letos jarní soustředění pro začátečníky. Zváni jsou všichni středoškoláci a starší základoškoláci, kteří se chtějí naučit programovat, lépe uvažovat o informatických úlohách a poznat nové podobně smýšlející kamarády. Úplným začátečníkům bude určen kurz základů programování a kurz základních algoritmických dovedností, pokročilejším nabídneme různorodé

    … více »
    skywalqer | Komentářů: 1
    22.2. 04:11 | Komunita

    Fedora je od 10. února dostupná v Sýrii. Sýrie vypadla ze seznamu embargovaných zemí a Fedora Infrastructure Team mohl odblokovat syrské IP adresy.

    Ladislav Hagara | Komentářů: 22
    22.2. 03:44 | Zajímavý projekt

    Ministerstvo zahraničí Spojených států amerických vyvíjí online portál Freedom.gov, který umožní nejenom uživatelům v Evropě přístup k obsahu blokovanému jejich vládami. Portál bude patrně obsahovat VPN funkci maskující uživatelský provoz tak, aby se jevil jako pocházející z USA. Projekt měl být původně představen již na letošní Mnichovské bezpečnostní konferenci, ale jeho spuštění bylo odloženo.

    NUKE GAZA! 🎆 | Komentářů: 29
    22.2. 03:33 | Komunita

    Byla vydána pro lidi zdarma ke stažení kniha The Book of Remind věnovaná sofistikovanému kalendáři a připomínači Remind.

    Ladislav Hagara | Komentářů: 1
    21.2. 23:55 | Nová verze

    Grafický editor dokumentů LyX, založený na TeXu, byl vydán ve verzi 2.5.0. Oznámení připomíná 30. výročí vzniku projektu. Novinky zahrnují mj. vylepšení referencí nebo použití barev napříč aplikací, od rozhraní editoru po výstupní dokument.

    |🇵🇸 | Komentářů: 0
    Které desktopové prostředí na Linuxu používáte?
     (18%)
     (6%)
     (0%)
     (11%)
     (27%)
     (2%)
     (5%)
     (1%)
     (12%)
     (26%)
    Celkem 946 hlasů
     Komentářů: 25, poslední 3.2. 19:50
    Rozcestník

    BashBastlení: Parsování HTML a ohákování textu

    26.9.2009 23:56 | Přečteno: 3026× | Linux | poslední úprava: 27.9.2009 13:43

    Občas si ubastlím nějaký "užitečný" skriptík. Co dnes: Skript, který mi každý den pošle SMS s přehledem suplování. | Přidání diakritiky ke stránce. | Referendum v Bashi.

    Bakaláři

    Gymnasium, které navštěvuji, používá IS Bakaláři. Ten vyblívá suplování do HTML souboru. Co kdyby se cronem spouštěl skript, který mi pošle SMS, jestli je nějaké suplování? Člověk by se ráno nemusel tlačit u Nastěnky...

    #!/bin/bash
    # Parsování suplování z Bakalářů
    # Nedostatečně otestovaná alfaverze (prověří Čas). Používejte na vlastní risiko.
    # Jan Hrach, <jenda zav hrach t eu>
    # 
    # Skript by pravděpodobně mohl fungovat i s jinými versemi Bakalářů,
    #  ale formát tabulky se může změnit.
    # Zejména další třída nemusí začínat "  " (dvěma mezerami), ale
    #  jen jednou (v jiné versi to tak skutečně je).
    # 
    # Skript má jediný parametr a tím je třída, pro kterou má získat suplování.
    # 
    # Testovací tabulky:
    #  http://gomora.hrach.eu/misc/suplobec-sample.htm (GSG Praha, na ní je skript odladěn)
    #  http://www.horackova.cz/suplovani/suplobec.htm (jiná verse BK)
    #
    
    SOUBOR=suplobec.htm
    TRIDA="$1"
    
    # wget a tak...
    # přihlášení a uložení sušenky, u nás má oficiálně platnost do konce session, takže by to
    # s --keep-session-cookies mělo stačit tak jednou za rok
    wget --save-cookies cookie.txt --keep-session-cookies "https://www.gsgpraha.cz/login.php" \
     --post-data="return=%2Fintranet%2F&username=hrachj&pass=----&loginButton=P%F8ihl%E1sit+se" -q -O /dev/null \
     --no-check-certificate
    # Tajné služby právě získaly vaše heslo. Gratulujeme.
    # Bohužel je stejně self-signed a nikde ve škole nevisí jeho fingeprint :-(
    
    # UPDATE: Centrální Mozek Lidstva dovoluje přihlásit se jenom jednou sušenkou najednou :-(
    
    # stáhnutí stránky se suplováním
    wget --load-cookies cookie.txt https://www.gsgpraha.cz/intranet/rozvrhy/suplobec.htm -O - -q \
     --no-check-certificate |\
     # Tajné služby právě získaly vaši sušenku. Gratulujeme.
     # je to ve win1250 s CRLF konci řádků
     recode cp1250..utf8 > $SOUBOR
    
    parsni_tr() {
      #vygrepnutí zpracovávaného řádku
      grep "  "$TRIDA $SOUBOR -A $((7 + $1)) | tail -n 7 |\
      #smazání tagů, komprese mezer - SMS musí být krátká, odstranění diakritiky, převedení na jeden řádek
      sed -e 's/<[^>]*>//g' | tr -d " " | iconv -f utf-8 -t us-ascii//translit | tr "\n" " " |\
      # když supluje, nemusí být uvedena cílová učebna
      sed -e 's/\ \;/ - /g' #|\
      # vyříznutí jen těch informací, které chci
      #cut -d " " -f 1,2,3,4,5,6
    }
    
    if grep "  "$TRIDA $SOUBOR > /dev/null; then
      # datum
      MESSAGE=`grep textlarge_3 $SOUBOR | cut -d " " -f 3`
      SUPL_NUM=0
      while true; do
        if [ $SUPL_NUM -gt 0 ]; then
          if grep "  "$TRIDA $SOUBOR -A $((7 + $SUPL_NUM * 10 )) | tail -n 8 | grep -E '(<p>  |</table>)' > /dev/null; then
            break
          fi
        fi
        if [ $SUPL_NUM -gt 100 ]; then
          # fallback
          #  1) může mu rupnout v kouli
          #  2) formát souboru se může změnit
          break
        fi
        SUPL_RES=`parsni_tr $(( $SUPL_NUM * 10 ))`
        MESSAGE="$MESSAGE $SUPL_RES,"
        SUPL_NUM=$(( $SUPL_NUM + 1 ))
      done
    else
      MESSAGE="$MESSAGE bohuzel nebylo tazeno zadne suplovani"
    fi
    
    MESSAGE=`echo $MESSAGE |\
      # misc. optimalisace délky
      sed -e 's/.hod/h/g' -e 's/ - /-/g' -e 's/supluje/supl/g' -e 's/spoji/spoj/g' -e 's/\,$//g' -e 's/odpada/odpad/g' -e 's/presun>>/pres/g' -e 's/presun/pres/g'`
    
    # Já si to posílám na mobil v síti T-Mobile
    # http://jenda.blog.root.cz/2007/10/29/sledovani-zmen-a-posilani-sms/
    echo $MESSAGE #| mail -s "SPL" ----@t-email.cz

    Pridani >> Přidání diakritiky

    Tady sídlí skript, kterému do formuláře dáte text a on vám ho vrátí ohákovaný. Je to ale dost opruz. Co si udělat bookmarklet - po kliknutí na záložku se vám stránka zobrazí ohákovaná? Použitelné hlavně při čtení NetMagu. Má to ještě trochu problémy s kódováním...

    Budete potřebovat webserver s Bashem. V LigHTTPd se to dělá takhle:

    cgi.assign = ( ".sh" => "/bin/bash" )

    Potom si přidáte do prohlížeče bookmark:

    javascript:window.location.href%20=%20"http://gomora.hrach.eu/ohakovani.sh?"%20+%20window.location.href;

    gomora.hrach.eu je můj experimentální server, můžete ho k tomu použít, ale nezaručuji, že bude mít 100% dostupnost. Skriptík vypadá takto a můžete si ho dát k sobě na server:

    echo "X-Powered-By: /bin/bash :-)"
    echo "Content-type: text/html; charset=UTF-8"
    echo ""
    
    STRANKA=`wget -q -O - "$QUERY_STRING" | sed -e 's/\&/%26/g'`
    
    
    wget -q -O - --post-data="usepre=1&text=$STRANKA" http://nlp.fi.muni.cz/cz_accent/index.php | tr -d "\n" | recode iso8859-2..utf8 | sed -e 's/.*    <TABLE cellpadding=10><TR><TD bgcolor=#b0e0ff>\(.*\)<\/PRE><\/TD><\/TR><\/TABLE>.*/\1/g' -e 's/\<\;/</g' -e 's/\>\;/>/g' -e 's/\&\;quot\;/\"/g' -e 's/\"\;/\"/g' -e 's/<PRE>//g' -e 's/\&\;nbsp\;/\ \;/g'

    Výsledek může vypadat třeba takto.

    Humr: irské referendum v Bashi

    REPLY=n; until [ "$REPLY" = y ]; do read -n 1 -s -p $'Souhlasíte s Lisabonskou smlouvou? [y/n]\n'; done; echo "Lisabonská smlouva schválena"
           

    Hodnocení: 100 %

            špatnédobré        

    Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

    Komentáře

    Vložit další komentář

    Limoto avatar 26.9.2009 23:59 Limoto | skóre: 32 | blog: Limotův blog
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu

    To suplování je dobrej nápad. To si taky pořídím :-)

    Jendа avatar 27.9.2009 00:04 Jendа | skóre: 78 | blog: Jenda | JO70FB
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu
    [Ten google prozradí věcí... Už jsem mezi zdejší komunitou stařec ;-)]

    Tvá škola má taky Bakaláře?
    Limoto avatar 27.9.2009 00:07 Limoto | skóre: 32 | blog: Limotův blog
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu

    Google je svině :-D

     

    Jo, má... Ale skript si stejně napíšu vlastní ;-)

    Jendа avatar 27.9.2009 00:10 Jendа | skóre: 78 | blog: Jenda | JO70FB
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu
    Ale skript si stejně napíšu vlastní ;-)
    Lepší, jednodušší, co? Tak ho sem pak přidej. Mně to na jeden řádek nejde. ;-)
    27.9.2009 01:47 Sleep_Walker
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu
    1. promenne do uvozovek, zvlast kdyz davas moznost uzivateli vstup (TRIDA=$1 - remember Bobby Tables ;)
    2. diky za info o hackujicim serveru, to jsem neznal
    3. add referendum - uvozovky a read ma i parametr -p :)
    Jendа avatar 27.9.2009 13:31 Jendа | skóre: 78 | blog: Jenda | JO70FB
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu
    remember Bobby Tables
    Bakaláři používají jako databázi Postgres, tak to by mě zajímalo, jestli by to někoho s takovým jménem oescapovalo :-)
    diky za info o hackujicim serveru, to jsem neznal
    Ano, je škoda, že to někteří autoři zdejších blogů nepoužívají. Občas to sice doplní špatně (když je víc možností s různým smyslem - hackujícím, háčkujícím ;), ale i tak se výsledný text čte lépe než dlouhý text bez diakritiky.
    add referendum - uvozovky a read ma i parametr -p :)
    Dobrý nápad ;-)
    Jendа avatar 27.9.2009 13:45 Jendа | skóre: 78 | blog: Jenda | JO70FB
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu
    Přečetl jsem si read -h ;-) a udělal jsem to ještě křupavější. To jsem zvědavý, jak to v tom Irsku 3.10. dopadne. Škoda, že nemají ^C...
    27.9.2009 07:06 pht | skóre: 48 | blog: pht
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu
    STRANKA=`wget -q -O - $QUERY_STRING | sed -e 's/\&/%26/g'`
    to je dobrej backdoor...
    In Ada the typical infinite loop would normally be terminated by detonation.
    Jendа avatar 27.9.2009 13:25 Jendа | skóre: 78 | blog: Jenda | JO70FB
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu
    1) Přidal jsem kolem toho uvozovky, ale to asi nepomůže, co? Asi bych měl kolem toho udělat PHP wrapper s escapeshellcmd(), nebo to jde vyřešit i nějak lépe?

    Ano, na skriptování jsem levý ;).

    2) Zkoušel jsem tomu i skriptu s wget $1 dávat jako parametr věci typu " | touch /tmp/soubor" a nějak se mi nedaří...
    27.9.2009 21:11 pht | skóre: 48 | blog: pht
    Rozbalit Rozbalit vše Re: BashBastlení: Parsování HTML a ohákování textu
    Uvozovky stačí.
    In Ada the typical infinite loop would normally be terminated by detonation.

    Založit nové vláknoNahoru

    ISSN 1214-1267   www.czech-server.cz
    © 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.