abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
    včera 17:22 | Zajímavý projekt

    Max Leiter v roce 2019 zkusil zprovoznit X server na iPadu (iOS). Nyní se k tématu vrátil a s pomocí LLM a balíčkovacích nástrojů Procursus rozběhl desktop s X11 i Waylandem. Jeho balíčky jsou dostupné v repozitáři xiOS.

    |🇵🇸 | Komentářů: 7
    včera 13:33 | IT novinky

    Společnost Google Cloud dnes oznámila, že její infrastruktura a služby byly oficiálně zařazeny do Katalogu cloud computingu vedeného Digitální a informační agenturou (DIA). Tato certifikace potvrzuje, že infrastruktura a služby Google Cloud splňují přísné bezpečnostní a regulační požadavky České republiky pro provoz cloudových služeb ve veřejném sektoru.

    Ladislav Hagara | Komentářů: 5
    včera 13:11 | IT novinky

    Vůbec poprvé v historii se stát při testování digitálních služeb obrací na širokou veřejnost. Digitální a informační agentura (DIA) a Ministerstvo vnitra zvou občany k zapojení do zátěžového testu eDokladů, které od loňského podzimu prošly optimalizací aplikace a posílením infrastruktury. Test proběhne 13. srpna ve 13:00 a pro jeho úspěch bude potřeba zapojení několika desítek tisíc občanů. Zapojení do testu je zcela dobrovolné a úkol

    … více »
    Ladislav Hagara | Komentářů: 24
    včera 13:00 | Nová verze

    FireDragon je webový prohlížeč, doposud založený na Floorpu, jednom z forků Firefoxu s větším důrazem na ochranu soukromí a přizpůsobení uživatelského rozhraní. Spravuje ho člen komunity distribuce Garuda Linux. Nové vydání verze 13 opouští Floorp a přechází přímo na Firefox s patchi z LibreWolfu a vlastními úpravami. Dostupný je také na Flathubu.

    |🇵🇸 | Komentářů: 0
    včera 05:44 | Zajímavý software

    picogame (GitHub) je malý 2D herní engine pro mikrokontroléry jako RP2040, čip uvnitř kapesní konzole Picopad. Hru napíšeš v Pythonu a vyzkoušíš ji v prohlížeči nebo desktopovém simulátoru. Až bude hotová, zkopíruješ ji na podporovanou desku. Na začátku nepotřebuješ C, sestavení firmwaru ani hardware.

    Ladislav Hagara | Komentářů: 1
    29.7. 19:22 | Nová verze

    Multiplatformní prohlížeč elektronických knih KOReader byl vydán ve verzi 2026.07 "Sailing Walrus". U PDF souborů s SMask lze vyčistit pozadí. Přibyla podpora Kobo v5 nebo základní podpora OPDS 2.0.

    Ladislav Hagara | Komentářů: 0
    29.7. 14:22 | Komunita

    Společnost Valve sponzoruje a společnost Collabora portuje RADV (open source Vulkan ovladač pro AMD GPU z projektu Mesa) na Windows.

    Ladislav Hagara | Komentářů: 0
    28.7. 20:44 | Zajímavý projekt

    Starling (GitHub) je desktopové prostředí vytvořeno umělou inteligencí (s dohledem jednoho vývojáře během šesti měsíců).

    Ladislav Hagara | Komentářů: 41
    28.7. 14:22 | IT novinky

    Dne 30. června 2026 byla završena fyzická realizace projektu Czech National Quantum Communication Infrastructure (CZQCI), tedy České národní kvantové komunikační infrastruktury. Projekt byl realizován od 1. března 2023 a financován z Národního plánu obnovy částkou 121,6 milionu Kč. Cílem podpořeného projektu bylo vybudovat základy národní kvantové komunikační infrastruktury a ověřit možnosti jejího praktického využití. Mezi

    … více »
    Ladislav Hagara | Komentářů: 3
    28.7. 14:11 | IT novinky

    Město Šumperk se stalo terčem kybernetického útoku, chod úřadu je omezen. Zjišťuje se, jestli unikla nějaká data. Cílem hackerů byla městská datová síť. První útoky zaznamenali odborníci na informační technologie již v pondělí večer, závady se ale plně projevily až dnes ráno. Město událost nahlásilo Národnímu úřadu pro kybernetickou a informační bezpečnost (NUKIB).

    Ladislav Hagara | Komentářů: 1
    Které desktopové prostředí na Linuxu používáte?
     (11%)
     (7%)
     (2%)
     (18%)
     (30%)
     (5%)
     (6%)
     (2%)
     (15%)
     (23%)
    Celkem 2286 hlasů
     Komentářů: 30, poslední 3.4. 20:20
    Rozcestník


    Dotaz: jak nahrát stovky souborů do databáze

    4.9.2018 09:44 urputnik
    jak nahrát stovky souborů do databáze
    Přečteno: 2165×
    Mám mnoho textových souborů, které budu potřebovat často prohledávat na základě zadaného regulárního výrazu. Rozhodl jsem se použít databázi. Slibuji si od toho, že prohledávání bude rychlejší než při použití ripgrepu. Zatím netuším jak efektivně nahrát stovky textových souborů do MySQL databáze z příkazového řádku nebo v shellu. Poradíte?

    Odpovědi

    4.9.2018 09:59 debian+
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    To som nedavno riesil :D ... Mal som 1 priecinok a v nom takmer 2 milion priecinkov s asi 1 suborom v kazdom priecinku.

    Len generovanie SQL dotazu trvalo 24-48 hodin (povodne malo 2-3 tyzdne v cistom).

    Ako na to.

    Musis manualne nahodit data. Zo suborov vytvor jeden dotaz (alebo n dotazov, kde v kazdom dotaze vkladas 10000 insertov - aspon tak u mna to bolo). A tie potom hodis do databazy. Ak sa zmesti cele do ram, ukladaj do /dev/shm a vystup si skopiruj (kukni df pre /dev/shm). Alebo ukladaj na disk, ale generuj docastne do /dev/shm a po 100 napr. vkladani, z /dev/shm to uloz do na disk.

    Tabulku si vytvor v phpmyadmin (instalacnu verziu pouzi zo stranky - v debian testing my bola blba). Vloz 2 insert, aby si videl syntax pre insert viac-vkladanim naraz.

    A logiku si naprogramuj v php (ma funkciu mysqli_real_escape_string() na spravne konvertovanie na vkladanie). Php je ma aj prebrate syntax z bash.

    Ak zaplatis, do 0.5 - 1 hodiny to mas. Ak mozes poslat tie data, dak Ti mozem rovno vytvorit jeden sql prikaz, ktory Ti rovno nahodi databazu. A poslat aj s programom, ktory pri tom vytvorim (ak do buducna ak by si potrebol si pridat).
    4.9.2018 10:07 debian+
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Ak sa zmestia do RAM, pouzi ramFS. /dev/shm je nim.
    6.9.2018 15:20 lazywriter
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Jelikož se zmiňuje SQL, tak se nejspíš předpokládá _relační_ databáze. A ta má takový název proto, že dobře řeší vztahy (cizím slovem relace) mezi záznamy. Takže není dobrý nápad ji znasilňovat na něco jiného. Když už nestačí doporučené hledání na disku, tak by mohly připadat do úvahy nějaké databáze, ale rozhodně ne relační. Napadá mě třeba nějaká dokumentová nosql databáze, např. Elasticsearch apod.
    6.9.2018 15:21 lazywriter
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    pardon, ukliknutí. Odpověď měla jít přímo na původní otázku.
    6.9.2018 17:28 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Relace je ten jeden záznam (n-tice) v tabulce.
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    7.9.2018 10:09 lazywriter
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Použít třeba Google přece není tak složité. Druhý odkaz na dotaz "relace databáze": https://office.lasakovi.com/access/tabulky/relace-vazby-v-databazich-teorie/

    Záznam se v relační teorii jmenuje entita. Proto se také schématu databáze někdy říká ER diagram od slov entita-relace (česky: záznam a jeho vztah k ostatním).
    4.9.2018 10:00 Aleš Kapica | skóre: 52 | blog: kenyho_stesky | Ostrava
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    A nebylo by lepší místo takové opičárny vyzkoušet sift?
    4.9.2018 10:04 debian+
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Ako to testovali/merali, lebo HDD a ani SD disk neda 30GB za 0.5s.

    Vid "Web log files search"
    4.9.2018 10:10 Aleš Kapica | skóre: 52 | blog: kenyho_stesky | Ostrava
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Nevím jak to testovali oni, ale pokud bych chtěl obejít IO omezení HDD, tak bych ty data hodil do ramdisku.

    Jinak tazatel chce prohledávat stovky textových souborů. To je úplná sranda proti prohledávání milionů malých souborů. Neuvedl taky co s tím pak chce dělat. Já si většinou takový soubor chci přečíst, proto je pro mne optimální klasická kombinace grep + less. A pokud bych chtěl něco svižnějšího, tak bych nejspíš vyzkoušel ten sift. Pořád mi to přijde lepší než se drbat s nějakou databází. Bez rozumné indexace to stejně nedává smysl.
    4.9.2018 10:55 Aleš Kapica | skóre: 52 | blog: kenyho_stesky | Ostrava
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Tak jsem to jen tak z legrace zkusil na svůj home. Obsahuje aktuálně 1044971 souborů (208GB). Co se mi líbilo, tj. že sift zvýrazňoval barevně cestu k souboru a nalezený vzorek. Sift také na rozdíl od grepu jel vícevláknově.

    Co jsem neošetřil, to bylo nastavení parametru aby nepřeskakoval příliš dlouhé řádky, takže 3130 souborů sift právě kvůli tomu přeskočil.
    sift
    real    17m12,227s
    user    2m28,896s
    sys     4m6,882s
    
    grep
    real    23m28,636s
    user    3m38,805s
    sys     3m57,037s
    
    4.9.2018 12:27 urputnik
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Tedy by mě zajímalo porovnání s prohledáváním v DB, ale to asi vyzkoušet nemůžete.
    4.9.2018 13:09 dustin | skóre: 63 | blog: dustin
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Nahrání do DB a indexace pro nějaký fulltext (který nezafunguje na regexp) je dost náročná operace. Samozřejmě pokud budeš hledat častěji (a bude možné použít nějaký index), přínos to mít může. Jinak bude varianta s mezikrokem do DB logicky delší, když dělá to samé a ještě mnoho navíc.
    4.9.2018 16:03 lertimir | skóre: 64 | blog: Par_slov
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Ano, souhlas. Podstatné je, že fultext index je sice mnohonásobně rychlejší, ale v podstatě je uvnitř jenom něco jako ekvivalent substringu. rozhodně to není regexp.
    4.9.2018 10:20 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Pokud ta data v souborech nejsou strukturována, tak ti konverze do databáze moc fungovat nebude a ztratíš pohodlí přímé editace. Jak dlouho tomu ripgrepu trvá, než nalezne výskyty vzorku?
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    4.9.2018 11:04 urputnik
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Strukturovana jsou, ale to bych v te db uz nejak vyresil. Treba tak, ze bych si cestu do adresare (strukturu) ukladal do tabulky vedle toho textu.

    Rychle to s tim ripgrepem je zatim dost, ale mam tech souboru jenom asi stovku. Brzy jich budou tisice.
    4.9.2018 11:10 debian+
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Strukturovana jsou, ale to bych v te db uz nejak vyresil. Treba tak, ze bych si cestu do adresare (strukturu) ukladal do tabulky vedle toho textu.
    To v ziadnom pripade!!!! ... Zvlast tabulka na nazvy a zvlast na data. A prepajas indexami.
    4.9.2018 11:22 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Je u všech souborů zachována stejná struktura sloupců nebo to má každý soubor jinak? Máš ty soubory v CSV nebo v jiném podobném formátu?
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    4.9.2018 12:23 urputnik
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Je to jen text, žádný formát to nemá.
    4.9.2018 12:51 Kit | skóre: 46 | Brno
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    V tom případě nedává moc smysl takové nestrukturované údaje ukládat do databáze. Jak velké jsou ty soubory a co od toho databázového řešení očekáváš?
    Komentáře označují místa, kde programátor udělal chybu nebo něco nedodělal.
    4.9.2018 13:32 Käyttäjä 11133 | skóre: 58 | blog: Ajattelee menneisyyttä
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    On ElasticSearch je taky databáze, víme? :-)
    4.9.2018 13:46 urputnik
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    V podstatě jde o to, jestli webový backend bude pracovat se strukturou souborů nebo s databází, ze které by se posléze vybraný text kopíroval do souboru, se kterým by se pracovalo -- překlad textového formátu do PDF a jiných formátů. Dneska už je běžné mít všechno v DB, je to rychlé a pohodlné a dobře rozšiřitelné. Na základě toho mě právě napadlo hrnout už to všechno přes DB, protože ta tam bude stejně, zejména pokud by to vyhledávání v DB mělo být rychlejší.
    4.9.2018 14:23 dustin | skóre: 63 | blog: dustin
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    Nepřijde mi, že je dnes běžné mít všechno v DB. Je to vždy o konkrétních potřebách.

    Pokud potřebuješ fulltext (ne regexpy, které zmiňuješ), pak to nahraj do elasticsearche, jak tady již bylo řečeno. Nevím o DB indexu, který by uměl urychlit obecný regexp.

    Mysql žádný pořádný fulltext nemá, navíc s podporou různých jazyků.

    Nebo použij Postgresql https://postgres.cz/wiki/Instalace_PostgreSQL#Instalace_Fulltextu
    Josef Kufner avatar 7.9.2018 11:11 Josef Kufner | skóre: 70
    Rozbalit Rozbalit vše Re: jak nahrát stovky souborů do databáze
    To, co chceš, je hlavně index. Pro obecné regexpy se indexovat nedá, ale pokud máš předem dané dotazy a přepíšeš je do jednoduchého hledání klíčových slov, tak už to půjde fulltextem.

    Na fulltext můžeš zkusit třeba Sphinx Search nebo již zmiňovaný Elastic Search. Fulltext v MySQL je dosti omezený.

    Import do databáze uděláš tak, že si napíšeš skript, který přečte soubor, sestaví SQL dotaz a pošle to do databáze. Je to na pár řádků. Doporučuju sáhnout po rozumném skriptovacím jazyce, např. Python nebo PHP. V shellu se z toho zblázníš.
    Hello world ! Segmentation fault (core dumped)

    Založit nové vláknoNahoru

    Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

    ISSN 1214-1267   www.czech-server.cz
    © 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.