abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
včera 15:55 | Zajímavý projekt

Vyzkoušet si příkazy a vyřešit několik úkolů lze na stránkách Commandline Challenge (CMD Challenge). Úkoly lze řešit různými způsoby, důležitý je výsledek. Zdrojové kódy jsou k dispozici na GitHubu pod licencí MIT.

Ladislav Hagara | Komentářů: 10
18.2. 17:35 | Bezpečnostní upozornění

Německá Bundesnetzagentur (obdoba českého ČTU) zakázala na německém území prodej panenky Cayla kvůli „špionáži“ dětí. Tato elektronická hračka obsahuje mikrofon, reproduktor a kameru a bezdrátové komunikační rozhraní, pomocí kterého se hračka připojuje na servery výrobce. Takovýmto způsobem může hračka pomocí umělé inteligence „odpovídat“ na dotazy dítěte. Hlavní problém bude ale asi někde jinde, podle prvotních zpráv může

… více »
Petr Tomášek | Komentářů: 25
17.2. 15:30 | Bezpečnostní upozornění

CSIRT.CZ upozorňuje, že bezpečnostní experti objevili nový typ malwaru, jenž cílí na open source e-commerce platformu Magento. Malware je zajímavý tím, že se jedná o první svého druhu, jehož kód zůstává skrytý v SQL databázi zasaženého e-shopu. Škodlivý kód je volán pomocí tzv. SQL trigerru, který je spouštěn při každém vytvoření objednávky v systému.

Ladislav Hagara | Komentářů: 2
17.2. 09:00 | Nová verze

Bylo vydáno Ubuntu 16.04.2 LTS, tj. druhé opravné vydání Ubuntu 16.04 LTS s kódovým názvem Xenial Xerus. Přehled novinek v poznámkách k vydání a v přehledu změn.

Ladislav Hagara | Komentářů: 50
17.2. 06:00 | Zajímavý článek

Pavel Tišnovský se v dvoudílném článku na MojeFedora.cz věnuje tvorbě pluginů (modulů) pro bitmapový grafický editor GIMP. Pomocí pluginů lze GIMP rozšiřovat o další funkce. Implementovat lze například nové filtry nebo pomocné utility pro tvorbu animací či poloautomatickou retuš snímků.

Ladislav Hagara | Komentářů: 6
16.2. 23:32 | Komunita

Do 30. března se lze přihlásit do dalšího kola programu Outreachy, jehož cílem je přitáhnout do světa svobodného a otevřeného softwaru lidi ze skupin, jež jsou ve světě svobodného a otevřeného softwaru málo zastoupeny. Za 3 měsíce práce, od 30. května do 30. srpna 2017, v participujících organizacích lze vydělat 5 500 USD. Jedná se již o 14. kolo tohoto programu.

Ladislav Hagara | Komentářů: 11
16.2. 23:13 | Nová verze

Byla vydána verze 0.92.1 svobodného multiplatformního vektorového grafického editoru Inkscape. Přehled novinek v poznámkách k vydání. Řešen je mimo jiné problém s verzí 0.92, jež rozbíjí dokumenty vytvořené v předchozích verzích Inkscape. Více v příspěvku na blogu Davida Revoye, autora open source webového komiksu Pepper&Carrot nebo portrétu GNU/Linuxu.

Ladislav Hagara | Komentářů: 0
16.2. 16:26 | Bezpečnostní upozornění

Byla vydána verze 1.1.0e kryptografické knihovny OpenSSL. Dle bezpečnostního upozornění 20170216 byla opravena závažná bezpečnostní chyba CVE-2017-3733.

Ladislav Hagara | Komentářů: 1
16.2. 13:03 | Pozvánky

GNOME hackaton proběhne v Brně na FIT VUT v Red Hat Labu (budova Q) v pondělí 20. února od 15:00. Registrace není nutná, ale pokud dáte na FaceBooku vědět, že plánujete dorazit, pomůže to s plánováním.

Ladislav Hagara | Komentářů: 0
16.2. 13:02 | Pozvánky

Únorový Prague Containers Meetup se koná 21. února v budově MSD. Můžete se těšit na přednášky o tom, proč a jak používat kontejnery a zároveň získat zajímavý pohled na historii a budoucnost kontejnerů.

little-drunk-jesus | Komentářů: 0
Jak se stavíte k trendu ztenčování přenosných zařízení (smartphony, notebooky)?
 (13%)
 (2%)
 (72%)
 (3%)
 (10%)
Celkem 657 hlasů
 Komentářů: 52, poslední 13.2. 12:45
Rozcestník
Reklama

Dotaz: Jakou db pouzit na vlastni "vyhledavac"?

2.8.2012 01:01 martina
Jakou db pouzit na vlastni "vyhledavac"?
Přečteno: 745×

ahoj,

 

poradte mi jakou technologii, db a jazyk pouzit na tohle:

 

"databaze" obsahujici kolem 10M clanku (delka textu 1-4 A4) (cast plaintext, cast html)

 

hw: xeon, 32gb ram, 3tb disk (raid1 - lepsiho nic neni)

 

a potrebuji udelat neco, co bude schopne hledat v tom duplicity/kopie. proste, zadam clanek (nebo aspon tri ctyri vety z nej) a potrebuji do par vterin mit vypsane bud presne nebo velmi podobne shody (tj. aby prosly i veci kde je vic mezer mezi slovy, atd.)

 

nemyslim si, ze mysql/pgsql a fulltext je na tohle dobre reseni.

 

mate nejaky tip? treba lucene?

 

dekuji,

martina

Odpovědi

2.8.2012 07:43 psholty2 | skóre: 7 | blog: char
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
2.8.2012 07:48 psholty2 | skóre: 7 | blog: char
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
A este asi budes potrebovat "Document Retrieval", mrkni na NLP lekcie na coursera.org (week 7 - Information retrieval), je tam popisany aj ten inverted index, potom v week 7 - ranked information retrieval je skore, asi tf-idf je najbeznejsie
3.8.2012 12:23 martina
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
diky, kouknu na to
5.8.2012 13:02 FooBar
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
Muzes rozvest, proc nemyslis, ze mysql/pgsql a jejich fulltext neni vhodny reseni? S MySQL fulltextem zkuenosti nemam, ale postgres fulltext by na tohle sel pouzit zcela trivialne.
5.8.2012 13:03 FooBar
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
*"proc myslis, ze je", samozrejme
6.8.2012 14:14 martina
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
no, mam strach, ze nebude to stihat vykonem (viz hw nahore). oproti nejakemu reseni na miru. tzn. povazuji fulltext u sql db za prilis obecne reseni (ale netusim, nikdy jsem takovou vec neresila).

ono, pokud bych z kazdeho clanku vybrala par vet (delsi nez 6 slov, kvuli hledani duplicit) a projela to oproti db, bylo by to pro me dostacujici. myslis, ze by tohle slo v pgdb s tim, ze budou vysledky temer okamzite?
6.8.2012 15:23 Ivan
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
No nevim. Podle me mas spatny poradi. Nejdriv se resi pozadavky na SW, algoritmus, konktretni SW produkt a teprve az nekonec se resi sizing. Jestli to pgSQL(anebo neco jinyho) utahne anebo ne, to se neda rict - nikdo nema tvoje data. To muze ukazat jedine test.

6.8.2012 15:37 FooBar
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
Nemam jedinej duvod si myslet, ze budou problemy -- prijde mi, ze ted resis jen premature optimization, coz je naprosta cesta do pekel.

Ve zkratce:
  1. Ziskej data.
  2. Rozhoduj se.
Nedelej to obracene. Nerozhoduj se na zaklade nepodlozenejch predpokladu o vykonu, a az budes ziskavat data na zaklade kterejch se budes rozhodovat, nezapomen si overit nekym zkusenejsim ze tam nejsou nejaky prehlednuty chyby (omylem chybejici index nebo tak neco veselyho).

Jako rule of thumb bych naprosto nevidel problem v FT vyhledavani nad ~40M normostranama, ale samozrejme zalezi na hromade dalsich faktoru, jako napriklad ocekavana charakteristika zateze.
rADOn avatar 8.8.2012 19:01 rADOn | skóre: 44 | blog: bloK | Praha
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
Pokud ti jde jen o nejaky ty mezery a podobny volovinky tak by stacilo nejak znormalizovat tu databazi. Pokud chces decentni vykon a opravdovej fulltext tak mrkni na sphinx. Vezme si nejaky misto na barely, ale lita jako drak. "Fulltext" v databazich je tak neco mezi tim, funkcne slabota ale zase je to jednoduchy na rozbehani. (sphinxka je docela elektrarna)
"2^24 comments ought to be enough for anyone" -- CmdrTaco
13.8.2012 12:01 Michal
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
Na fulltext db se mi osvedcilo Lucene (Java API) a Solr (HTTP/REST API postavene nad Lucene enginem). Velice dobre konfigurovatelne, jsou tam ruzne filtry, dalsi lze napsat, atd. Hledat duplikaty tam jde velice jednoduse, a to i v pripade ze nejde o 100% shodu.
13.8.2012 17:09 Michal Karas | skóre: 45 | blog: /dev/random
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
Když už jsou zmíněny tyto technologie, tak bych přidal i ElasticSearch, který je také postavený na Lucene a přijde mi, že v poslední době je minimálně stejně populární jako Solr.
14.8.2012 07:45 ML
Rozbalit Rozbalit vše Re: Jakou db pouzit na vlastni "vyhledavac"?
Já jsem si zvyk na http://sphinxsearch.com/ , celekm fajn. :)

Založit nové vláknoNahoru

Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

ISSN 1214-1267   www.czech-server.cz
© 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.