abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
    včera 20:44 | IT novinky

    Na lasvegaském veletrhu elektroniky CES byl předveden prototyp notebooku chlazeného pomocí plazmových aktuátorů (DBD). Ačkoliv se nejedná o první nápad svého druhu, nepochybně to je první ukázka praktického použití tohoto způsobu chlazení v běžné elektronice. Co činí plazmové chladící akční členy technologickou výzvou je především vysoká produkce jedovatého ozonu, tu se prý podařilo firmě YPlasma zredukovat dielektrickou

    … více »
    NUKE GAZA! 🎆 | Komentářů: 1
    včera 16:33 | Zajímavý projekt

    Patchouli je open source implementace EMR grafického tabletu (polohovací zařízení). Projekt je hostován na GitLabu.

    Ladislav Hagara | Komentářů: 0
    včera 14:11 | IT novinky

    Český Nejvyšší soud potvrdil, že česká právní úprava plošného uchování dat o elektronické komunikaci porušuje právo Evropské unie. Pravomocným rozsudkem zamítl dovolání ministerstva průmyslu a obchodu. To se teď musí omluvit novináři Českého rozhlasu Janu Cibulkovi za zásah do práv na ochranu soukromí a osobních údajů. Ve sporu jde o povinnost provozovatelů sítí uchovávat údaje, ze kterých lze odvodit, kdo, s kým a odkud komunikoval.

    Ladislav Hagara | Komentářů: 4
    včera 02:11 | Komunita

    Google bude vydávat zdrojové kódy Androidu pouze dvakrát ročně. Ve 2. a 4. čtvrtletí.

    Ladislav Hagara | Komentářů: 0
    7.1. 17:22 | Zajímavý článek

    Bezpečnostní specialista Graham Helton z Low Orbit Security si všímá podezřelých anomálií v BGP, zaznamenaných krátce před vstupem ozbrojených sil USA na území Venezuely, které tam během bleskové speciální vojenské operace úspěšně zatkly venezuelského diktátora Madura za narkoterorismus. BGP (Border Gateway Protocol) je 'dynamický směrovací protokol, který umožňuje routerům automaticky reagovat na změny topologie počítačové sítě' a je v bezpečnostních kruzích znám jako 'notoricky nezabezpečený'.

    NUKE GAZA! 🎆 | Komentářů: 8
    7.1. 06:11 | Nová verze

    Společnost Valve aktualizovala přehled o hardwarovém a softwarovém vybavení uživatelů služby Steam. Podíl uživatelů Linuxu dosáhl 3,58 %. Nejčastěji používané linuxové distribuce jsou Arch Linux, Linux Mint a Ubuntu. Při výběru jenom Linuxu vede SteamOS Holo s 26,32 %. Procesor AMD používá 67,43 % hráčů na Linuxu.

    Ladislav Hagara | Komentářů: 3
    7.1. 05:55 | IT novinky

    V Las Vegas probíhá veletrh CES (Consumer Electronics Show, Wikipedie). Firmy představují své novinky. Například LEGO představilo systém LEGO SMART Play: chytré kostky SMART Brick, dlaždičky SMART Tagy a SMART minifigurky. Kostka SMART Brick dokáže rozpoznat přítomnost SMART Tagů a SMART minifigurek, které se nacházejí v její blízkosti. Ty kostku SMART Brick aktivují a určí, co má dělat.

    Ladislav Hagara | Komentářů: 0
    6.1. 18:33 | Bezpečnostní upozornění

    Vládní CERT (GovCERT.CZ) upozorňuje (𝕏) na kritickou zranitelnost v jsPDF, CVE-2025-68428. Tato zranitelnost umožňuje neautentizovaným vzdáleným útočníkům číst libovolné soubory z lokálního souborového systému serveru při použití jsPDF v prostředí Node.js. Problém vzniká kvůli nedostatečné validaci vstupu u cest k souborům předávaných několika metodám jsPDF. Útočník může zneužít tuto chybu k exfiltraci citlivých

    … více »
    Ladislav Hagara | Komentářů: 6
    6.1. 16:22 | Komunita

    V úterý 13. ledna 2025 se v pražské kanceláři SUSE v Karlíně uskuteční 5. Mobile Hackday, komunitní setkání zaměřené na Linux na mobilních zařízeních, kernelový vývoj a související infrastrukturu. Akci pořádá David Heidelberg.

    … více »
    lkocman | Komentářů: 0
    6.1. 16:00 | Pozvánky

    Už je 14 dní zbývá do začátku osmého ročníku komunitního setkání nejen českých a slovenských správců sítí CSNOG 2026. Registrace na akci je stále otevřená, ale termín uzávěrky se blíží. I proto organizátoři doporučují, aby se zájemci přihlásili brzy, nejlépe ještě tento týden.

    … více »
    VSladek | Komentářů: 0
    Které desktopové prostředí na Linuxu používáte?
     (1%)
     (4%)
     (0%)
     (10%)
     (22%)
     (4%)
     (5%)
     (3%)
     (11%)
     (54%)
    Celkem 295 hlasů
     Komentářů: 7, poslední včera 15:35
    Rozcestník

    Dotaz: Převod UTF-8 do UNICODE v C

    tomes.io avatar 2.3.2012 19:48 tomes.io | skóre: 12 | blog: tomesh
    Převod UTF-8 do UNICODE v C
    Přečteno: 2141×
    Zdravim,

    resim problem v C tykajici se prevodu kodovani. Na vstupu predpokladam korektni HEX znak v UTF-8 kodovani v rozsahu 1-4 bajty. Vystupem pak ma byt tento znak prevedeny do HEX unicode. Vychazim z informaci na wiki (ale i jinde) o UTF-8 kodovani. Napsal jsem nasledujici fci vyuzivajici bitove masky (x je ze scanf("%X", &x) ktere se posle jako vstup do fce:

    unsigned int convUnicode(int x) {

    unsigned int y = 0, m = 0, n = 0;

    m = y = n = x;

    x = (x & 0x7000000);

    x = x >> 6;

    n = (n & 0xF0000);

    n = n >> 4;

    m = (m & 0x3F00);

    m = m >> 2;

    y = (y & 0x003F);

    x = x | y | m | n;

    printf("0x%X\n", x);

    return 0; }

    Problem je ten, ze u jednobitovych znaku mi fce na outputu dava korektne jen cisla 1-39- 40 vypise jako 0x0, 41 jako 0x1 atd. az do 80. 80 vypise jako 0x0, 81 jako 0x1... proste to jakoby funguje jen po cislo 39 ap ka to jede od znovu. VIcebitove vstupy jsem zatim netestoval moc, dosud se zdaji byt korektni, ale musim to testovat na vetsi skale cisel.

    Opravdu by me zajimalo, v cem delam chybu. S praci na bitove urovni mam v C opravdu minimalni zkusenosti, takze by me zajimalo, co a jak delam blbe. Idealne, kdyby mi nekdo poradil, nebo apson navedl na zpusob korektni implemntace. Nechci aby to nekdo vyresil za me, jen chci nakopnout.

    Řešení dotazu:


    Odpovědi

    tomes.io avatar 2.3.2012 20:00 tomes.io | skóre: 12 | blog: tomesh
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Tak jsem si vsiml chybky, na wikinach o UTF-8 kodovani pisou o 007F... atd. a ja mam 003F..

    Unicode kód od - do Binární zápis znaku v UTF-8 0000 0000 - 0000 007F 0xxxxxxx 0000 0080 - 0000 07FF 110xxxxx 10xxxxxx 0000 0800 - 0000 FFFF 1110xxxx 10xxxxxx 10xxxxxx 0001 0000 - 001F FFFF 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

    Nicmene, i po uprave masek na 007F se mi HEX korektne vypisuje jen do vstupu 79 (= 0x79). 80 uz koduje jako 0x0.. :( Je jasne, ze do 127 se jedna porad o ASCII, ale jak to namaskovat, aby tam byla ta implementace UTF-8 do UNICODE?
    2.3.2012 20:32 Kit
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Máš to nějaké zmatené.
    • Co je to jednobitový znak?
    • Proč to neděláš klasicky odčítáním nebo rychle přes mapu?
    • Co je to HEX znak v UTF-8 kodovani v rozsahu 1-4 bajty? UTF-8 může být na 1-6 bytech, když to bude HEX, tak 2-12 bytů
    • Co si představuješ pod pojmem "Vícebitové vstupy?" Všechny znaky v UTF-8 jsou vícebitové
    • Proč ty proměnné posouváš po 2 bitech?
    • Proč na výpis programu nepoužíváš <pre>, aby se to dalo číst?
    tomes.io avatar 2.3.2012 20:49 tomes.io | skóre: 12 | blog: tomesh
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    ad 1) 1 bitovy znak: myslel jsem 1 bajtový znak. napriklad cislo 68.

    ad 2) psal jsem, ze na bitove urovni jsem nikdy neprogramoval, je to pro me spanelska vesnice, bohuzel jsme tento priklad dostali za domaci ukol. nevedel jsem vubec, od ceho se odpichnout, takze nevim, jak se to dela "klasicky" odcitanim (co se od ceho odcita?), nikdo me neucil zadny rychly zpusob pres mapu, nas postavili ve skole pred hotovou vec...(zadani znelo: Vašou úlohou je napísať program, ktorý číta hexadecimálne kódy znakov UTF-8 zo štandardného vstupu. do hodnoty znaku v Unicode tabuľke. prvé číslo v dekadickom formáte, určuje počet nasledovných čísiel, číslo bude vždy validný UTF-8 kód)

    ad 3) - na vstupu se predpoklada UTF-8 znak v hexadecimalnim tvaru

    ad 4) myslel jsem vicebajtove, spatne jsem to napsal

    ad5) myslel jsem, ze kdyz se treba 2 bajtove cislo pomoci masky "oreze" tak je treba ho oṕosunout o orezany pocet bitu. jak rikam, jsem v tomto novacek a jak vidis, hodne v tom plavu, takze experimentuju a zkousim...ten posuv pri dekoduje korektne nektere znaky (napr pri vstupu CAAC mi korektne vypise vystup 2AC)

    ad6) protoze jsem debil :) odted budu pouzivat
    2.3.2012 20:41 Vlk
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Domácí úkol do úvodu v Cčku na Fakultě informatiky MU ? :-)
    2.3.2012 20:49 Jan Trávníček | skóre: 10 | blog: ehonza | Existuje
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Nebo na FIT CVUT?
    To mess up a Linux box, you need to work at it; to mess up your Windows box, you just have to work on it.
    tomes.io avatar 2.3.2012 20:50 tomes.io | skóre: 12 | blog: tomesh
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Ano :) vzhledem k tomu, ze jsem nezastihnul studentskeo poradce, zkousim se ptat tady. Potrebuju nakopnout, tohle bitovep ocitani je pro me neco uplne novyho..
    2.3.2012 20:47 lertimir | skóre: 64 | blog: Par_slov
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    tomes.io avatar 2.3.2012 21:26 tomes.io | skóre: 12 | blog: tomesh
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    JA se nesnazim nic vynalezt to chran Buddha :)

    Jen je tohle pro me absolutne nove, takze se snazim prijit na to, co s tim. Jak vytvorit spravne masky, jak je pouzit. Nikdy predtim jsem to nedelal, to je jako kdyz posadis cloveka ktery sely zivot ridil v superbu do lady nivy...

    Rekli nam, ze vse potrebne najdem na wiki, nebo googlu. OK, mam tady tu tabulku:
    U-00000000 – U-0000007F: 	0xxxxxxx
    U-00000080 – U-000007FF: 	110xxxxx 10xxxxxx
    U-00000800 – U-0000FFFF: 	1110xxxx 10xxxxxx 10xxxxxx
    U-00010000 – U-001FFFFF: 	11110xxx 10xxxxxx 10xxxxxx 10xxxxxx
    U-00200000 – U-03FFFFFF: 	111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx
    U-04000000 – U-7FFFFFFF: 	1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxx
    Nerudovska otazka, co s ni? 0 - 7F to je prvnich 127, tedy ASCII. Otazka zni: uzit nejakou masku?

    U-00000080 – U-000007FF:. Tak a ted jak zprvniho bajtu oriznout 110 a z druheho 10?

    Kdyz pouziju:
    scanf("%X", &x);
    
    x = (x & 0x7FF);
    
    printf("0x%X\n", x);
    Tak se zda, ze to dekoduje v pohode.

    Ale v pripade 3 bajtoveho (U-00000800 – U-0000FFFF) znaku to uz nedekoduje v pohode:
    x = (x & 0xFFFF);
    Takze ja proste nevim jak spravne vyuzit tu tabulku z wiki a dalsich odkazu, nevim jak to spravne namaskovat.

    Mozna by to slo postupnym rozlozenim cisla na jednotlive bajty a ty pak orezat. Ale nevim, jak se takovy rozklad v C implementuje...
    2.3.2012 21:34 l4m4
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Tak a ted jak zprvniho bajtu oriznout 110 a z druheho 10?
    Musíš oříznout ty správné bity, použít opererátory bitového posunu << a >>, abys je posunul, kam patří ve výsledném bajtu, a zkombinovat výsledek pomocí |.

    P.S.: Převod UTF-8 do UNICODE nedává smysl. UTF-8 je representace Unicode, takže co je v UTF-8, to už je v Unicode.
    tomes.io avatar 3.3.2012 21:56 tomes.io | skóre: 12 | blog: tomesh
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Tak jsem to vyresil takto. Snad jsem pokryl vsechny moznosti pro 1-4 bajtove vstupy:
     if (x <= 0x7F){ //testuje zda je znak 1 bajtovy ANSII
    
            printf("0x%X\n", x);
    
          }  else if ((x > 0x7F) && (x <= 0xBF)) { //testuje zda je znak jednobajtovy, s hodnotou vyssi nez ANSII
    
                    x = (x & 0x003f);
    
                    printf("0x%X\n", x);
    
          } else if ((x > 0xBF) && (x <= 0xDFBF)){  //testuje dvoubajtove znaky
    
                   x = ((x & 0x1f00) >> 2) | (x & 0x003f);
    
                   printf("0x%X\n", x);
    
          } else if ( (x > 0xDFBF) && (x <= 0xEFBFBF)) { //testuje tribajtove znaky
    
                   x = (((x & 0xF0000) >> 4) | ((x & 0x3f00) >>2) | (x & 0x003f));
    
                   printf("0x%X\n", x);
    
          } else if ((x > 0xEFBFBF) && (x <= 0xF7BFBFBF )){  //testuje ctyrbajtove znaky
    
                    x = ( ((x & 0x7000000) >> 6) | ((x & 0x3f0000) >> 4) | ((x & 0x3f00) >>2) | (x & 0x003f));
    
                   printf("0x%X\n", x);
          }
    
          return 0;
     }
    Jinak UTF-8 do unicode samozreme smysl ma:
    http://www.utf8-chartable.de/
    Cely priklad je vlastne prevodnik z UTF-8 do UNICODE a z UNICODE do UTF-16.
    3.3.2012 22:12 l4m4
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Jinak UTF-8 do unicode samozreme smysl ma
    Ne, tato věta je výrazem nepochopení vztahu Unicode a UTF-8. UTF-8 můžeš převést leda do nějaké jiné representace Unicode, ale pořád bude nějak representováno.

    Tabulka bloku prvních 256 znaků má dokazovat konkrétně co?
    tomes.io avatar 3.3.2012 22:16 tomes.io | skóre: 12 | blog: tomesh
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Mozna je to blbe napsane, nebo spis malo jednoznacne. Oficialni zadani zni takto:
    Vašou úlohou je napísať program, ktorý číta hexadecimálne kódy znakov UTF-8 zo štandardného vstupu. Jednotlivé kódy dekóduje najprv do hodnoty znaku v Unicode tabuľke, následne znak opäť zakóduje podľa UTF-16.
    "dekoduje do hodnoty v UNICODE"
    3.3.2012 22:19 l4m4
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Získat z UTF-8 hodnotu znaku (codepoint) v Unicode je samozřejmě smysluplné zadání.
    tomes.io avatar 3.3.2012 22:24 tomes.io | skóre: 12 | blog: tomesh
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Ja to chapu tak, ze tu mame sadu znaku UNICODE, ktera se da ruzne kodovat. UTF-8 i UTF-16 jsou ruzne druhy kodovani teze sady UNICODE. Takze nevim, v cem je problem :) Maximalne, v tom, ze jsem to nepresne napsal,to je vsecko...
    tomes.io avatar 3.3.2012 22:12 tomes.io | skóre: 12 | blog: tomesh
    Rozbalit Rozbalit vše Re: Převod UTF-8 do UNICODE v C
    Hm tak to rozdeleni testovani jednobajtoveho je asi blbost. Staci:
     if (x <= 0xBF){ //testuje zda je znak 1 bajtovy
    
            printf("0x%X\n", x);

    Založit nové vláknoNahoru

    Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

    ISSN 1214-1267   www.czech-server.cz
    © 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.