abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
    dnes 12:22 | IT novinky

    Elon Musk prohrál soudní spor se společností OpenAI, která se podle jeho žaloby odchýlila od původně uváděného cíle vyvíjet umělou inteligenci (AI) ku prospěchu lidstva. Porota včera po necelých dvou hodinách dospěla k jednomyslnému závěru, že Musk žalobu podal příliš pozdě. Musk byl jedním ze spoluzakladatelů společnosti OpenAI, která vznikla v roce 2015 a vyvinula populární chatovací systém ChatGPT. V roce 2018 na svůj post ve vedení

    … více »
    Ladislav Hagara | Komentářů: 0
    dnes 10:22 | Nová verze

    Byla vydána nová verze 10.4 z Debianu vycházející linuxové distribuce DietPi pro (nejenom) jednodeskové počítače. Přehled novinek v poznámkách k vydání. Opraveny jsou zranitelnosti Copy Fail a Dirty Frag. Přibyl nový obraz pro Orange Pi 5B.

    Ladislav Hagara | Komentářů: 0
    dnes 07:44 | Zajímavý software

    Pokud je zranitelnost Linuxu v nepoužívaném jaderném modulu, lze ji jednoduše vyřešit zakázáním automatického načítání tohoto konkrétního zranitelného modulu. Projekt ModuleJail si klade za cíl zvýšit bezpečnost Linuxu zakázáním automatického načítání všech nepoužívaných jaderných modulů. Jedná se o skript, který dá všechny nepoužívané jaderné moduly na blacklist (/etc/modprobe.d/modulejail-blacklist.conf).

    Ladislav Hagara | Komentářů: 0
    včera 16:11 | Zajímavý článek

    Odborníci z Penn State University zkoumají způsob ukládání informací na lepicí pásku. Principiálně by podle nich bylo možné kombinací odlepení a zpětného přilepení dosáhnout uložení informace, kterou opětovným odlepením dokážou přečíst. Výhodou je, že způsob uložení i přečtení je čistě mechanický. Zde o tom referují ve volně dostupném článku. Zajímavé bude sledovat zda se jim v rámci výzkumu podaří prokázat použitelnost i v jiné než

    … více »
    karkar | Komentářů: 9
    včera 13:00 | Zajímavý projekt

    Na GitHubu byl publikován reprodukovatelný návod, jak rozchodit Adobe Lightroom CC na Linuxu a Wine. Návod byl vytvořený pomocí AI Claude Code.

    Ladislav Hagara | Komentářů: 0
    včera 12:33 | Humor

    Pokud by někdo potřeboval Wayland kompozitor uvnitř počítačové hry Minecraft, aby mohl zobrazovat okna desktopových aplikací přímo v herním prostředí, může sáhnout po Waylandcraftu. Ukázka na YouTube.

    Ladislav Hagara | Komentářů: 2
    17.5. 23:55 | Zajímavý článek

    Uroš Popović v krátkém článku vysvětluje, co jsou emulátor terminálu, TTY a shell a jaké jsou mezi nimi rozdíly. Jde o první díl seriálu na jeho novém webu Linux Field Guide věnovaném nízkoúrovňové práci s linuxovými systémy.

    |🇵🇸 | Komentářů: 0
    16.5. 22:33 | Nová verze

    Byl vydán Debian 13.5, tj. pátá opravná verze Debianu 13 s kódovým názvem Trixie a Debian 12.14, tj. čtrnáctá opravná verze Debianu 12 s kódovým názvem Bookworm. Řešeny jsou především bezpečnostní problémy, ale také několik vážných chyb. Instalační média Debianu 13 a Debianu 12 lze samozřejmě nadále k instalaci používat. Po instalaci stačí systém aktualizovat.

    Ladislav Hagara | Komentářů: 0
    15.5. 12:55 | Nová verze

    CiviCRM (Wikipedie) bylo vydáno v nové verzi 6.14.0. Podrobnosti o nových funkcích a opravách najdete na release stránce. CiviCRM je robustní open-source CRM systém navržený speciálně pro neziskové organizace, spolky a občanské iniciativy. Projekt je napsán v jazyce PHP a licencován pod GNU Affero General Public License (AGPLv3). Český překlad má nyní 45 % přeložených řetězců a přibližuje se milníku 50 %. Potřebujeme vaši pomoc, abychom se dostali dál. Pokud máte chuť přispět překladem nebo korekturou, přidejte se na platformu Transifex.

    jardaIT | Komentářů: 3
    15.5. 12:22 | Bezpečnostní upozornění

    Další lokální zranitelností Linuxu je ssh-keysign-pwn. Uživatel si může přečíst obsah souborů, ke kterým má právo ke čtení pouze root, například soubory s SSH klíči nebo /etc/shadow. V upstreamu již opraveno [oss-security mailing list].

    Ladislav Hagara | Komentářů: 2
    Které desktopové prostředí na Linuxu používáte?
     (13%)
     (8%)
     (2%)
     (14%)
     (31%)
     (4%)
     (6%)
     (3%)
     (16%)
     (26%)
    Celkem 1653 hlasů
     Komentářů: 30, poslední 3.4. 20:20
    Rozcestník

    Zabili Kennyho bastardi!

    2.2.2014 22:14 | Přečteno: 1538× | Stunome | poslední úprava: 3.2.2014 12:55

    Aneb malé povídání o n-gramech a Rku. Honzíkovi slibuji, že to bude mít větší hodnotu a lepší formátovaní než minule!

    Analyzuji, tedy jsem

    O co nám dnes půjde? Na vstupu máme titulky (anglické) z kompletní první série seriálu Southpark a budeme zjišťovat, jestli se v textu neobjevují nějaké opakující se patterny. K analýze nám poslouží tradičně jazyk R a jeho knihovny textcat, tau a k zobrazení výsledků pak wordcloud.

    Zdrojový kód

    Jako první si někde obstaráme textové soubory s titulky, které budeme analyzovat. Ty umístíme do jednoho adresáře, v našem případě nazvaném "southpark", a s tím již pracujeme v R. Dále načteme potřebné knihovny a vytvoříme korpus, který bude obsahovat náš adresář.

    library(textcat)
    library(tau)
    library(wordcloud)
    
    korpus <- Corpus(DirSource("southpark", encoding="UTF-8"), readerControl = list(language = "en"))
    

    Dále si do proměnné ngramy uložíme výsledek funkce textcnt, které předáváme v parametru n řád n-gramu. Postupně jsem to provedl pro n=1, 2, 3 a 4.

    ngramy <- textcnt(korpus, method = "string",n=3)
    

    Abychom mohli výsledek zobrazit jako wordcloud, musíme jej převézt z formátu textcnt na dataframe. To řeší následující příkaz:

    df <- data.frame(word = names(ngramy), freq=unclass(ngramy))
    

    Zbytek již je opakování z minula:

    pal2 <- brewer.pal(8,"Dark2")
    png("wordcloud_ngram.png", width=1024,height=768)
    wordcloud(df$word,df$freq, scale=c(10,.2),min.freq=3,
    max.words=150, random.order=FALSE, rot.per=.15, colors=pal2)
    dev.off()
    

    Výsledek

    V prvním kroku nám vyjde úplně normální wordcloud, který je dosti nevypovídající - nebyla použita žádná stopwords, a tak převládají členy "a" a "the".

    V dalším kroku pro n=2 je výsledek již zajímavější. Mezi nejčastějšími spojeními dvou slov se nám již objeví "south park", ale pořád to hyzdí nicneříkající "have to", "are you" a podobné.

    U n=3 začíná být výsledek již opravdu zajímavý. Mezi nejčastějšími tříslovnými výrazy se objevují věci jako "oh my god", což je klasická Cartmanovská hláška, popřípadě "Terrance and Phillip" podle které Southpark zcela jistě identifikujeme a "Kathie Lee Gifford", která prostě musí zemřít!

    A máme tady zlatý hřeb večera - n=4! Zde dominuje především asi nejvíce WTF věta "hut hut hut hut", u které doteď nevím co znamená. Southpark se dá rozeznat podle "my god they killed" a "a big fat ass". Pro n-gram pro čtyři slova je problematická především malá délka vstupního textu, kvůli čemuž máme velmi málo výsledků a nejsou příliš reprezentativní.

    Bonus

    Jako bonus jsem spočítal a vykreslil do grafu vzdálenost slov "killed", "kenny" a "bastards" v jednotlivých epizodách. Výsledek zde:

    Závěr

    Měření dopadlo úspěšně a nebyl při něm nikdo zraněn. Na pár příkladech jsme si předvedli, jak analyzovat text z pohledu výskytů sousloví. Největší smysl dávají asi 3-gramy, u kterých jde relativně dobře poznat, jaký text byl analyzován. U kratších spojení narážíme na přílišnou obecnost, zde by bylo potřeba implementovat zakázaná slova. U delších je pak problém v krátkosti textu. Pokud byste si chtěli něco podobného zkusit a nechtěli si při tom složitě instalovat R a hledat, které RStudio je nejlepší, vyzkoušejte online Voyant-tools. O kostičku se hlaste v komentářích!

           

    Hodnocení: 88 %

            špatnédobré        

    Obrázky

    Zabili Kennyho bastardi!, obrázek 1 Zabili Kennyho bastardi!, obrázek 2 Zabili Kennyho bastardi!, obrázek 3 Zabili Kennyho bastardi!, obrázek 4 Zabili Kennyho bastardi!, obrázek 5

    Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

    Komentáře

    Vložit další komentář

    Bedňa avatar 2.2.2014 23:01 Bedňa | skóre: 34 | blog: Žumpa | Horňany
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Čakal by som že vyhrá "Zabili Kennyho parchanti", ale ako vidím tak táto hláška sa drží dosť bokom, hoci je v každom diely. Si si istý že analýza prebehla korektne?
    KERNEL ULTRAS video channel >>>
    2.2.2014 23:41 mich | skóre: 16
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Pro n=3 máš: "oh my god", "killed kenny you" a "god they killed".
    Pro n=4: "oh my go they" a "my god they killed".
    Ta hláška je v originále: "Oh my god they killed Kenny. You bastards!"
    je to teď v módě, na žive o tom furt píšou
    Bedňa avatar 2.2.2014 23:58 Bedňa | skóre: 34 | blog: Žumpa | Horňany
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    To mi jasné, ale ten výskyt podľa grafov nedáva za pravdu tomu čo som si myslel.
    KERNEL ULTRAS video channel >>>
    Bedňa avatar 3.2.2014 00:10 Bedňa | skóre: 34 | blog: Žumpa | Horňany
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    A jasne, trojslovné súvetia, tak sorry :)
    KERNEL ULTRAS video channel >>>
    |🇵🇸 avatar 3.2.2014 11:02 |🇵🇸 | skóre: 94 | blog:
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Jenom ve starších sériích.

    Screw you guys, I'm going home. >_<
    🇵🇸Touch grass🇺🇦 ✊ ani boha, ani pána
    AsciiWolf avatar 2.2.2014 23:50 AsciiWolf | skóre: 41 | blog: Blog
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Já chci kostičku!
    3.2.2014 09:55 Honz
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Radši ani nechci vědět, co znamená u vás v klubu "analizuji"...
    pools avatar 3.2.2014 10:03 pools | skóre: 19 | blog: Svědek Damdogův | Opava/Praha
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    To znamená píšu to v noci a nečtu to po sobě ty jedna fašistická svině!
    Vivre libre ou mourir!
    3.2.2014 10:49 Asdasdasdad
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Daj si diazepamový čípok - najprv dole a potom do nosa!
    3.2.2014 11:33 Luboš L.
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Anál lížu jí?
    Agent avatar 3.2.2014 21:22 Agent | blog: Life_in_Pieces | HC city
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Tak si to přeslabikuj nahlas třeba celej článek a zkus to uhádnout z kontextu. Možná budeš překvapen.
    Nevěděl zpočátku, co si počít, jak žít, co dělat, ale brzy se vpravil do role samotáře.
    3.2.2014 11:47 vyskocil
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    A Kednedyho zabili Sionsiticki Bastardi
    grubber avatar 5.2.2014 09:44 grubber | skóre: 6 | blog: grubber | Břeclav / Brno
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Zde dominuje především asi nejvíce WTF věta "hut hut hut hut", u které doteď nevím co znamená.
    Že by More crap?
    pools avatar 5.2.2014 17:04 pools | skóre: 19 | blog: Svědek Damdogův | Opava/Praha
    Rozbalit Rozbalit vše Re: Zabili Kennyho bastardi!
    Díky!
    Vivre libre ou mourir!

    Založit nové vláknoNahoru

    ISSN 1214-1267   www.czech-server.cz
    © 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.