jake se mapuje web?

Máme WWW server, běží už dlouho a nevíme, co všecko na něm je. V zásadě HTML stránky, ale taky PHP aplikace, různé věci od různých autorů z různých dob. Jsou toho tisíce souborů. Potřebujeme to nějak zmapovat. Představoval bych si něco jako jako robota, který by začal na jednom URL toho webu, šel by po odkazech a tak by našel množinu vystavených URL a jak se mezi sebou odkazujou. Kdyby byl chytřejší, mohl by třeba i hádat, které URL dohromady dávají jednu prezentaci a které URL je v té prezentaci počáteční. Úplně sám by to jistě nezvládnul, musela by to být interaktivní aplikace. Nevíte o nějakých nástrojích na tohle téma?

Odpovědi

Proč to dělat tak složitě? Pokud máte k serveru přístup, tak find / -iname '*.html' -or -iname '*.php' -or ... najde všechny zajímavé soubory a jejich umístění. Navíc soubory pod jedním adresářem budou velmi pravděpodobně patřit do jedné prezentace.

When your hammer is C++, everything begins to look like a thumb.

7.8.2008 14:55 krnoha | skóre: 10 | blog: prizpevy
Rozbalit Rozbalit vše Re: jake se mapuje web?

Současně ale potřebuju získat představu o tom, jak se soubory volají mezi sebou a zejména které nejsou volány vůbec a lze je tedy zrušit. U PHP souborů může tag <A> být generován, takže nějakým grepováním ho nenajdu. Prohledávat HTML soubory poskytované webserverem po síti bude taky trochu práce, ale aspoň víme, že je to HTML. Některé stránky jsou přístupné jenom z intranetu a některé odevšad, takže spuštěním prohledávače z různých míst internetu dostaneme různé mapy webu. Takže proto tak složitě.

7.8.2008 16:32 Andrej Herceg | skóre: 43
Rozbalit Rozbalit vše Re: jake se mapuje web?

Problém je aj to, že na niektoré stránky sa môže dať dostať len po prihlásení, prípadne sa tá stránka vygeneruje až po odoslaní nejakých údajov (cez formulár)... Takže bez ručného prehľadávania to aj tak asi nepôjde.

Představoval bych si něco jako jako robota, který by začal na jednom URL toho webu, šel by po odkazech a tak by našel množinu vystavených URL a jak se mezi sebou odkazujou.

Tohle zvládne i wget, na to nepotřebujete žádného specializovaného robota.

8.8.2008 11:31 krnoha | skóre: 10 | blog: prizpevy
Rozbalit Rozbalit vše Re: jake se mapuje web?

Pythonský program, který bude volat wget, prohlídne si co dostal, zatřídí si to do asociaticního pole a jde na další. Ano to je jasný. Jenom že nějak tiše doufám, že už je to vyřešeno i s vyzkoušenými heuristikami na shlukování "souborů" do "prezentací", s vykoumaným zobrazením výsledků a tak podobně.

8.8.2008 11:56 Filip Jirsák | skóre: 67 | blog: Fa & Bi
Rozbalit Rozbalit vše Re: jake se mapuje web?

Vyřešeno to už je, a řeší to samotný wget, bez Pythonu. Podívejte se na parametry

--recursive, --level, --mirror, --accpet, --reject, --domains, --exclude-domains, --span-hosts, --include-directories, --exclude-directories, --no-parent, --page-requisites

8.8.2008 14:15 krnoha | skóre: 10 | blog: prizpevy
Rozbalit Rozbalit vše Re: jake se mapuje web?

wget mi to stáhne, ale kdo to za mě přečte?

8.8.2008 14:36 Filip Jirsák | skóre: 67 | blog: Fa & Bi
Rozbalit Rozbalit vše Re: jake se mapuje web?

Obávám se, že program, který by to za vás přečetl, neexistuje. Ale v původním dotazu není nic o tom, že byste to měl číst – tam je jenom dotaz na to, jak udělat zrcadlo několika webů. Vy tam sice píšete něco o prezentaci a startovací stránce, ale i ta prezentace bude umístěna pod jedním doménovým jménem a pravděpodobně v jednom adresáři. Takže ono rozdělení na prezentace pak znamená jen od sebe oddělit příslušné adresáře – a v tom vám žádný interaktivní program nepomůže, to uděláte nejrychleji ručně.

lol :) Zajímalo by mě, co jste zač :-)

Podíval bych se do konfigurace www serveru (tzn. Apache nebo co tam běží), které virtualhosty tam jsou a kde mají document root, popř. odkud je ještě možnost spouštět další skripty.

Já osobně bych to ale prostě vypnul a sledoval, co komu začne chybět (protože předpokládám, že to je obsah, za který vám nikdo neplatí, neboť jinak byste v tom neměli takový bordel nebo by vám do toho bordelu nic nebylo). Třeba to celé už pár běželo úplně zbytečně :-)

(Stejně tak si lze prohlédnout accesslogy webserveru.)

8.8.2008 11:43 krnoha | skóre: 10 | blog: prizpevy
Rozbalit Rozbalit vše Re: jake se mapuje web?

Jsme akademická instituce, nic na kšeft. Tenhle web tady běží od roku 95, různí lidé na něj něco přidávali, prostě dostali prostor a do něj dali, co si napsali v nějakém editoru. Server zakládali vědci, byl koncipován velmi promyšleně, proto tak dlouho vydržel. Ale teď už je obsah neudržovatelný. Tím není řečeno, že se má zahodit - stránky je nutné zkonvertovat do vhodného nového systému. Analýza obsahu je IMHO nutná.

Jedna možnost: google, site:yoursite.cz možná najde co je dostupné a prolinkované

Možná půjde použít Metis, i když s ním nemám nejlepší zkušenosti. Možná i wget.

Ale jak psali přede mnou, je dost pravděpodobné že řešíte špatný problém, a každé řešení bude pochybné.

8.8.2008 11:25 Tom.š Ze.le.in | skóre: 21 | blog: tz
Rozbalit Rozbalit vše [OT] pro jazykově-mytologické puristy

A ano, vím že Metis byla ona, ne on :)

8.8.2008 12:06 krnoha | skóre: 10 | blog: prizpevy
Rozbalit Rozbalit vše Re: jake se mapuje web?

Ten Metis vypadá zajímavě. Dík, zkusím to. Poslední verze je z roku 03. Asi řešíme teď problém, který byl hromadný na přelomu století.

Dotaz: jake se mapuje web?

Odpovědi