abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
dnes 12:33 | Nová verze

Byla vydána nová stabilní verze 1.8 (1.8.770.50) webového prohlížeče Vivaldi (Wikipedie). Z novinek vývojáři zdůrazňují vylepšenou historii prohlížení. Ukázka na YouTube. Chromium bylo aktualizováno na verzi 57.0.2987.111.

Ladislav Hagara | Komentářů: 0
dnes 05:55 | Zajímavý projekt

Google na svém blogu věnovaném open source představil portál Google Open Source informující mimo jiné o více než 2000 open source projektech vyvíjených nebo používaných v Googlu.

Ladislav Hagara | Komentářů: 0
dnes 03:33 | IT novinky

Pro společnost Red Hat skončil 28. února fiskální rok 2017. Dle finančních výsledků bylo čtvrté čtvrtletí, stejně jako celý fiskální rok 2017, opět úspěšné. Tržby jsou zvyšovány již 60 čtvrtletí v řadě. Za čtvrté čtvrtletí 2017 to bylo 629 milionů dolarů, tj. meziroční nárůst 16 %. Tržby za celý fiskální rok činily 2,4 miliardy dolarů, tj. meziroční nárůst 18 %.

Ladislav Hagara | Komentářů: 2
včera 18:22 | Bezpečnostní upozornění

V balíčku eject, příkaz pro vysunutí CD/DVD z mechaniky, v linuxových distribucích Ubuntu (USN-3246-1) a Debian (#858872) byla nalezena bezpečnostní chyba CVE-2017-6964 zneužitelná k lokální eskalaci práv. Linuxové distribuce používající eject z balíčku util-linux nejsou zranitelné.

Ladislav Hagara | Komentářů: 14
včera 05:55 | Komunita

Dries Buytaert, autor a vedoucí projektu Drupal a prezident Drupal Association, požádal soukromě před několika týdny Larryho Garfielda, jednoho z klíčových vývojářů Drupalu, aby projekt Drupal opustil. Larry Garfield minulý týden na svých stránkách napsal, že důvodem jsou jeho BDSM praktiky a rozpoutal tím bouřlivou diskusi. Na druhý den reagoval Dries Buytaert i Drupal Association. Pokračuje Larry Garfield [reddit].

Ladislav Hagara | Komentářů: 55
včera 04:44 | Humor

Společnost SAS zveřejnila na svých stránkách studii s názvem Open Source vs Proprietary: What organisations need to know (pdf). Organizace by měly například vědět, že ideální je mix 40 % open source softwaru a 60 % proprietárního softwaru [Slashdot].

Ladislav Hagara | Komentářů: 12
27.3. 23:33 | Zajímavý software

Byl vydán ShellCheck ve verzi 0.4.6. Jedná se o nástroj pro statickou analýzu shellových skriptů. Shellové skripty lze analyzovat na webové stránce ShellChecku, v terminálu nebo přímo z textových editorů. Příklady kódů, na které analýza upozorňuje a doporučuje je přepsat. ShellCheck je naprogramován v programovacím jazyce Haskell. Zdrojové kódy jsou k dispozici na GitHubu pod licencí GPLv3.

Ladislav Hagara | Komentářů: 0
27.3. 23:33 | Pozvánky

Czech JBoss User Group zve na setkání JBUG v Brně, které se koná ve středu 5. dubna 2017 v prostorách Fakulty informatiky Masarykovy univerzity v místnosti A318 od 18:00. Přednáší Pavol Loffay na téma Distributed Tracing and OpenTracing in Microservice Architecture.

… více »
mjedlick | Komentářů: 0
27.3. 11:33 | Zajímavý článek

Národní centrum kybernetické bezpečnosti (NCKB) vypracovalo (pdf) 26 podrobných bezpečnostních doporučení pro síťové správce. Tato doporučení jsou nastavena tak, aby je bylo možné aplikovat v každé instituci. Jsou rozdělena na tři základní části: bezpečnost infrastruktury, bezpečnost stanic a serverů a bezpečnost uživatelů.

Ladislav Hagara | Komentářů: 17
27.3. 05:55 | Komunita

Prezident Nadace pro svobodný software (FSF) Richard M. Stallman vyhlásil na slavnostním ceremoniálu v rámci konference LibrePlanet 2017 vítěze Free Software Awards za rok 2016. Ocenění za společenský přínos získal SecureDrop (Wikipedie). Za rozvoj svobodného softwaru byl oceněn Alexandre Oliva (Wikipedie).

Ladislav Hagara | Komentářů: 0
Jak se stavíte k trendu ztenčování přenosných zařízení (smartphony, notebooky)?
 (14%)
 (2%)
 (72%)
 (3%)
 (10%)
Celkem 963 hlasů
 Komentářů: 72, poslední 1.3. 11:16
    Rozcestník

    Dotaz: Jakou db pouzit na vlastni "vyhledavac"?

    2.8.2012 01:01 martina
    Jakou db pouzit na vlastni "vyhledavac"?
    Přečteno: 745×

    ahoj,

     

    poradte mi jakou technologii, db a jazyk pouzit na tohle:

     

    "databaze" obsahujici kolem 10M clanku (delka textu 1-4 A4) (cast plaintext, cast html)

     

    hw: xeon, 32gb ram, 3tb disk (raid1 - lepsiho nic neni)

     

    a potrebuji udelat neco, co bude schopne hledat v tom duplicity/kopie. proste, zadam clanek (nebo aspon tri ctyri vety z nej) a potrebuji do par vterin mit vypsane bud presne nebo velmi podobne shody (tj. aby prosly i veci kde je vic mezer mezi slovy, atd.)

     

    nemyslim si, ze mysql/pgsql a fulltext je na tohle dobre reseni.

     

    mate nejaky tip? treba lucene?

     

    dekuji,

    martina

    Odpovědi

    2.8.2012 07:43 psholty2 | skóre: 7 | blog: char
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    2.8.2012 07:48 psholty2 | skóre: 7 | blog: char
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    A este asi budes potrebovat "Document Retrieval", mrkni na NLP lekcie na coursera.org (week 7 - Information retrieval), je tam popisany aj ten inverted index, potom v week 7 - ranked information retrieval je skore, asi tf-idf je najbeznejsie
    3.8.2012 12:23 martina
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    diky, kouknu na to
    5.8.2012 13:02 FooBar
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    Muzes rozvest, proc nemyslis, ze mysql/pgsql a jejich fulltext neni vhodny reseni? S MySQL fulltextem zkuenosti nemam, ale postgres fulltext by na tohle sel pouzit zcela trivialne.
    5.8.2012 13:03 FooBar
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    *"proc myslis, ze je", samozrejme
    6.8.2012 14:14 martina
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    no, mam strach, ze nebude to stihat vykonem (viz hw nahore). oproti nejakemu reseni na miru. tzn. povazuji fulltext u sql db za prilis obecne reseni (ale netusim, nikdy jsem takovou vec neresila).

    ono, pokud bych z kazdeho clanku vybrala par vet (delsi nez 6 slov, kvuli hledani duplicit) a projela to oproti db, bylo by to pro me dostacujici. myslis, ze by tohle slo v pgdb s tim, ze budou vysledky temer okamzite?
    6.8.2012 15:23 Ivan
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    No nevim. Podle me mas spatny poradi. Nejdriv se resi pozadavky na SW, algoritmus, konktretni SW produkt a teprve az nekonec se resi sizing. Jestli to pgSQL(anebo neco jinyho) utahne anebo ne, to se neda rict - nikdo nema tvoje data. To muze ukazat jedine test.

    6.8.2012 15:37 FooBar
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    Nemam jedinej duvod si myslet, ze budou problemy -- prijde mi, ze ted resis jen premature optimization, coz je naprosta cesta do pekel.

    Ve zkratce:
    1. Ziskej data.
    2. Rozhoduj se.
    Nedelej to obracene. Nerozhoduj se na zaklade nepodlozenejch predpokladu o vykonu, a az budes ziskavat data na zaklade kterejch se budes rozhodovat, nezapomen si overit nekym zkusenejsim ze tam nejsou nejaky prehlednuty chyby (omylem chybejici index nebo tak neco veselyho).

    Jako rule of thumb bych naprosto nevidel problem v FT vyhledavani nad ~40M normostranama, ale samozrejme zalezi na hromade dalsich faktoru, jako napriklad ocekavana charakteristika zateze.
    rADOn avatar 8.8.2012 19:01 rADOn | skóre: 44 | blog: bloK | Praha
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    Pokud ti jde jen o nejaky ty mezery a podobny volovinky tak by stacilo nejak znormalizovat tu databazi. Pokud chces decentni vykon a opravdovej fulltext tak mrkni na sphinx. Vezme si nejaky misto na barely, ale lita jako drak. "Fulltext" v databazich je tak neco mezi tim, funkcne slabota ale zase je to jednoduchy na rozbehani. (sphinxka je docela elektrarna)
    "2^24 comments ought to be enough for anyone" -- CmdrTaco
    13.8.2012 12:01 Michal
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    Na fulltext db se mi osvedcilo Lucene (Java API) a Solr (HTTP/REST API postavene nad Lucene enginem). Velice dobre konfigurovatelne, jsou tam ruzne filtry, dalsi lze napsat, atd. Hledat duplikaty tam jde velice jednoduse, a to i v pripade ze nejde o 100% shodu.
    13.8.2012 17:09 Michal Karas | skóre: 45 | blog: /dev/random
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    Když už jsou zmíněny tyto technologie, tak bych přidal i ElasticSearch, který je také postavený na Lucene a přijde mi, že v poslední době je minimálně stejně populární jako Solr.
    14.8.2012 07:45 ML
    Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
    Já jsem si zvyk na http://sphinxsearch.com/ , celekm fajn. :)

    Založit nové vláknoNahoru

    Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

    ISSN 1214-1267   www.czech-server.cz
    © 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.