abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×

včera 18:11 | Nová verze

Společnost Oracle oficiálně oznámila vydání Java SE 9 (JDK 9), Java Platform Enterprise Edition 8 (Java EE 8) a Java EE 8 Software Development Kit (SDK). Java SE 9 přináší více než 150 nových vlastností.

Ladislav Hagara | Komentářů: 0
včera 12:11 | Komunita

Na Humble Bundle lze získat hororovou počítačovou hru Outlast (Wikipedie) běžící také v Linuxu zdarma. Speciální akce končí v sobotu v 19:00.

Ladislav Hagara | Komentářů: 1
včera 10:33 | Humor

Mozilla.cz upozorňuje na Knihu Mozilly (Wikipedie), tj. velikonoční vajíčko ve Firefoxu. Zobrazit jej lze zadáním about:mozilla do adresního řádku. Aktuální verze Firefoxu obsahuje proroctví 15:1 "Dvojčata Mamonu se rozhádala a jejich souboje uvrhly svět do nové tmy. Zvířeti se ale tma hnusila. A tak se stalo mrštnější a silnější, šlo vpřed a jeho počty rostly. A zvíře přineslo oheň a světlo do tmy". Firefox 57 bude obsahovat proroctví 11:14. To je zatím jenom v angličtině. Pomoci lze s překladem do češtiny.

Ladislav Hagara | Komentářů: 10
včera 01:22 | Zajímavý projekt
Před měsícem byla spuštěna kampaň na podporu chytrého telefonu Librem 5, jenž by měl respektovat bezpečnost, svobodu a soukromí uživatelů. Cílem kampaně je vybrat alespoň milion a půl dolarů. Aktuálně je vybráno přes 600 000 dolarů, tj. 40 %. Kampaň poběží ještě další měsíc. Podporu projektu oznámilo KDE i GNOME.
Ladislav Hagara | Komentářů: 31
včera 00:55 | Komunita

Agentura DISA (Defense Information Systems Agency) publikovala (pdf) Ubuntu 16.04 Security Technical Implementation Guide (STIG) (zip), tj. doporučené bezpečnostní nastavení Ubuntu 16.04. Ubuntu se tak dostalo mezi unixové operační systémy a linuxové distribuce AIX, HP-UX, Oracle Linux, Red Hat a Solaris [reddit].

Ladislav Hagara | Komentářů: 2
21.9. 22:55 | Bezpečnostní upozornění

CSIRT.CZ informuje, že byly vydány nové bezpečnostní aktualizace, které opravují několik zranitelných míst v Sambě. Útočník může využít zranitelnosti s cílem získání přístupu k potenciálně citlivých informací. Uživatelům a správcům je doporučeno, aby zkontrolovali bezpečnostní opatření pro CVE-2017-12150, CVE-2017-12151 a CVE-2017-12163 a provedli potřebné aktualizace.

Ladislav Hagara | Komentářů: 0
21.9. 21:44 | Komunita

Společnost Red Hat aktualizovala svůj slib ohledně softwarových patentů. Slib nově zahrnuje i open source software pod permisivními licencemi.

Ladislav Hagara | Komentářů: 0
21.9. 08:55 | Komunita

Do 22. září probíhá v Mountain View konference XDC2017 (X.Org Developer's Conference). Na programu je řada zajímavých přednášek. Sledovat je lze online. K dispozici je záznam přednášek ze včerejšího dne.

Ladislav Hagara | Komentářů: 0
20.9. 17:33 | Nová verze

Byla vydána nová stabilní verze 1.12 (1.12.955.36) webového prohlížeče Vivaldi (Wikipedie). Z novinek vývojáři zdůrazňují možnost zobrazení metadat u digitálních fotografií, vylepšený panel stahování a omezení sytosti barvy zdůraznění (YouTube). Nejnovější Vivaldi je postaveno na Chromiu 61.0.3163.91.

Ladislav Hagara | Komentářů: 40
20.9. 10:55 | Nová verze

Byla vydána verze 4.0 programovacího jazyka Swift (Wikipedie). Zdrojové kódy jsou k dispozici na GitHubu. Ke stažení jsou oficiální binární balíčky pro Ubuntu 16.10, Ubuntu 16.04 a Ubuntu 14.04.

Ladislav Hagara | Komentářů: 5
Těžíte nějakou kryptoměnu?
 (5%)
 (3%)
 (17%)
 (75%)
Celkem 559 hlasů
 Komentářů: 22, poslední 29.8. 11:23
    Rozcestník

    Dotaz: PHP: Regulární výraz a diakritika v UTF-8

    9.6.2009 15:44 N0rT0n | skóre: 9 | blog: Lama | Brno
    PHP: Regulární výraz a diakritika v UTF-8
    Přečteno: 4051×

    Zdravím,

    řešil už někdo prapodivné chování PHP funkce mb_ereg() ?

    regulární výraz

    mb_ereg("^[a-zA-Z]*$","příšera")

    se vyhodnotí negativně, zatímco regulární výraz

    mb_ereg("^[a-zA-Z]*","příšera")

    se vyhodnotí pozitivně (odstraněn znak pro konec řetězce).

    Výraz:

    mb_ereg("^[a-zA-Z]*$","prisera")

    se vyhodnoti pozitivně.

     

    Narazil jsem na tento problém při sestavování podstatně složitějšího výrazu, který u slov bez diakritiky fungoval naprosto bez problému. Problém je v tom, že ve výrazu nutně potřebuji omezit chování konec řetězce. Všechny patterny obsahující znak $ (pro konec řetězce) se vyhodnocují automaticky negativně.

    Vstupem i výstupem je kódování UTF-8. mb_internal_encoding() hlasi UTF-8, mb_regex_encoding() taktéž. Tím, že řetězce na vstupu jsou v UTF-8, jsem si naprosto jist. Verze PHP je 5.2.6.

     

    Má někdo nějaký nápad, či případně toto nějak řešil?

    Odpovědi

    9.6.2009 16:01 Blondak
    Rozbalit Rozbalit vše Re: PHP: Regulární výraz a diakritika v UTF-8

    mb_ereg("^[a-zA-Z]*","příšera")
    se vyhodnocuje správně pozitivně, protože souhlasí "p" na začátku, pokud budeš dělat
    mb_ereg("^[a-zA-Z]*","činka")
    tak to už vyhodnotí negativně, možná bych zkusil
    preg_match("/^[\S]*$/u","příšera")
    , ale nevím co přesně máš na vstupech.

    9.6.2009 17:41 Ash | skóre: 53
    Rozbalit Rozbalit vše Re: PHP: Regulární výraz a diakritika v UTF-8
    se nevyhodnocuje správně pozitivně proto, že souhlasí "p" na začátku, ale proto, že výrazu ^[a-zA-Z]* vyhovuje jakýkoliv řetězec, který má začátek (to má každý) a pak náseduje 0 až N výskytů a-zA-Z. Takže by vyhovovala i šíšera.
    10.6.2009 04:01 zha
    Rozbalit Rozbalit vše Re: PHP: Regulární výraz a diakritika v UTF-8
    Takže by vyhovovala i šíšera.

    Měla by, ale proč neprojde ta činka?
    10.6.2009 07:39 Ash | skóre: 53
    Rozbalit Rozbalit vše Re: PHP: Regulární výraz a diakritika v UTF-8
    činka projde
    10.6.2009 10:56 Blondak
    Rozbalit Rozbalit vše Re: PHP: Regulární výraz a diakritika v UTF-8

    jj, pravda nějak jsem si spletl * a +

    Tarmaq avatar 9.6.2009 16:31 Tarmaq | skóre: 39
    Rozbalit Rozbalit vše Re: PHP: Regulární výraz a diakritika v UTF-8
    je to jak kolega pise v tom, ze v prvnim pripade se ten regular vyhodnoti jen na p
    nevim jestli je to uplne koser reseni, ale slo by to asi udelat nejak takto:
    setlocale(LC_CTYPE, 'cs_CZ.utf8');
    $foo = iconv('utf-8', 'ascii//TRANSLIT', "příšera");
    
    # mb_ereg se vyhodnoti pozitivne
    mb_ereg("^[a-zA-Z]*$", $foo);
    
    # jinak lze pouzit i tento tvar
    mb_ereg("^[[:alpha:]]*$", $foo);
    
    Don't panic!
    9.6.2009 17:24 Sinuhet | skóre: 31
    Rozbalit Rozbalit vše Re: PHP: Regulární výraz a diakritika v UTF-8
    preg_match("/^\p{L}*$/", "příšera");
    9.6.2009 17:40 N0rT0n | skóre: 9 | blog: Lama | Brno
    Rozbalit Rozbalit vše Re: PHP: Regulární výraz a diakritika v UTF-8

    Díky za reakce,

    ten nápad s iconv mě taky napadl. Leč jsem si stále myslel, že mě napadne něco elegantního. V tom skriptu se jedná o ošetření vkládání klíčových slov. Pravidla jsou taková, že mohou začínat libovolným písmenem, mohou obsahovat číslici, od sebe jsou odděleny čárkou (či případně čárkou a mezerou) a musí končit slovem. Žádné jiné znaky nejsou povoleny, takže nelze použít třídu [[:alpha:]]. Vše až na to ošetření konce slova jsem už zvládl.

    Správně by se měl vyhodnotit tento řetězec (i s vloženou frází "sportovní náčiní"):

    činka, sportovní náčiní, číslo21, google
    

    chybně by se měl vyhodnotit řetězec obsahující například:

    činka, sportovní náčiní, 21. století, google,

    (slovo nesmí začínat číslicí, tečka není přípustná a řetězec nesmí končit žádným jiným znakem, než [a-zA-Z0-9]). Něco jako

    ^[a-zA-Z0-9]*(,| )*[a-zA-Z0-9]*$
    
    9.6.2009 19:16 N0rT0n | skóre: 9 | blog: Lama | Brno
    Rozbalit Rozbalit vše Re: PHP: Regulární výraz a diakritika v UTF-8

    Moc elegantní to není, ale snad by to mohlo pomoci někomu, kdo podobný problém řeší:

    $foo = iconv('utf-8', 'ASCII//IGNORE', $text);
    if(ereg('^([a-zA-Z]{1,}[0-9]*(,| ){0,1})*[a-zA-Z]{1,}[0-9]*$',$foo)) {

      $result=1;

    } else { $result=0; }

    /*

    1) do proměnné $foo se překóduje text z proměnné $text, která je kódována v UTF-8, proměnná $foo je nyní reprezentována v kódování ASCII s tím, že znaky, které nemohly být zkonvertovány do ASCII "tiše" zmizí (zajišťuje příznak //IGNORE)

    2) klíčová slova musí začínat písmenem a případně končit číslicí, mezi slovy je přípustná čárka (oddělovač klíčových slov) nebo mezera (oddělovač slov v slovní frázi). Celý regulární výraz musí končit slovem (případně slovem s číslicí na konci).

    */

     Vypadá to, že to funguje, že jsem neudělal chybu (po 11 hodinách v práci by mě to ani nepřekvapilo).

     

    Založit nové vláknoNahoru

    Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

    ISSN 1214-1267   www.czech-server.cz
    © 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.