abclinuxu.cz AbcLinuxu.cz itbiz.cz ITBiz.cz HDmag.cz HDmag.cz abcprace.cz AbcPráce.cz
AbcLinuxu hledá autory!
Inzerujte na AbcPráce.cz od 950 Kč
Rozšířené hledání
×
eParkomat, startup z ČR, postoupil mezi finalisty evropského akcelerátoru ChallengeUp!
Robot na pivo mu otevřel dveře k opravdovému byznysu
Internet věcí: Propojený svět? Už se to blíží...
dnes 16:24 | Nová verze

Byla vydána Mageia 5.1. Jedná se o první opravné vydání verze 5, jež vyšla v červnu loňského roku (zprávička). Uživatelům verze 5 nepřináší opravné vydání nic nového, samozřejmě pokud pravidelně aktualizují. Vydání obsahuje všechny aktualizace za posledního téměř půldruhého roku. Mageia 5.1 obsahuje LibreOffice 4.4.7, Linux 4.4.32, KDE4 4.14.5 nebo GNOME 3.14.3.

Ladislav Hagara | Komentářů: 0
dnes 13:42 | Pozvánky

V Praze probíhá konference Internet a Technologie 16.2, volné pokračování jarní konference sdružení CZ.NIC. Konferenci lze sledovat online na YouTube. K dispozici je také archiv předchozích konferencí.

Ladislav Hagara | Komentářů: 0
včera 22:44 | Komunita

Joinup informuje, že Mnichov používá open source groupware Kolab. V srpnu byl dokončen dvouletý přechod na toto řešení. V provozu je asi 60 000 poštovních schránek. Nejenom Kolabu se věnoval Georg Greve ve své přednášce Open Source: the future for the European institutions (SlideShare) na konferenci DIGITEC 2016, jež proběhla v úterý 29. listopadu v Bruselu. Videozáznam přednášek z hlavního sálu je ke zhlédnutí na Livestreamu.

Ladislav Hagara | Komentářů: 15
včera 15:30 | Zajímavý projekt

Společnost Jolla oznámila v příspěvku Case study: Sailfish Watch na svém blogu, že naportovala Sailfish OS na chytré hodinky. Využila a inspirovala se otevřeným operačním systémem pro chytré hodinky AsteroidOS. Použita je knihovna libhybris. Ukázka ovládání hodinek na YouTube.

Ladislav Hagara | Komentářů: 8
včera 14:15 | Nová verze

Byla vydána verze 7.1.0 skriptovacího jazyka PHP používaného zejména k vývoji dynamických webových stránek. Jedná se o první stabilní verzi nejnovější větvě 7.1. Přehled novinek v dokumentaci. Podrobnosti v ChangeLogu. K dispozici je také příručka pro přechod z PHP 7.0.x na PHP 7.1.x.

Ladislav Hagara | Komentářů: 2
včera 12:55 | Nová verze

Google Chrome 55 byl prohlášen za stabilní. Nejnovější stabilní verze 55.0.2883.75 tohoto webového prohlížeče přináší řadu oprav a vylepšení (YouTube). Opraveno bylo také 36 bezpečnostních chyb. Mariusz Mlynski si například vydělal 22 500 dolarů za 3 nahlášené chyby (Universal XSS in Blink).

Ladislav Hagara | Komentářů: 4
včera 11:55 | Pozvánky

Máte rádi svobodný software a hardware nebo se o nich chcete něco dozvědět? Přijďte na 135. sraz spolku OpenAlt, který se bude konat ve čtvrtek 8. prosince od 18:00 v Radegastovně Perón (Stroupežnického 20, Praha 5). Sraz bude tentokrát tématický. Bude retro! K vidění budou přístroje jako Psion 5mx nebo Palm Z22. Ze svobodného hardwaru pak Openmoko nebo čtečka WikiReader. Přijďte se i vy pochlubit svými legendami, nebo alespoň na pivo. Moderní hardware má vstup samozřejmě také povolen.

xkucf03 | Komentářů: 0
včera 00:10 | Nová verze

Byla vydána verze 3.2 svobodného systému pro detekci a prevenci průniků a monitorování bezpečnosti počítačových sítí Suricata. Z novinek lze zmínit například podporu protokolů DNP3 a CIP/ENIP, vylepšenou podporu TLS a samozřejmě také aktualizovanou dokumentaci.

Ladislav Hagara | Komentářů: 0
1.12. 21:00 | Nová verze

Byla vydána beta verze Linux Mintu 18.1 s kódovým jménem Serena. Na blogu Linux Mintu jsou hned dvě oznámení. První o vydání Linux Mintu s prostředím MATE a druhé o vydání Linux Mintu s prostředím Cinnamon. Stejným způsobem jsou rozděleny také poznámky k vydání (MATE, Cinnamon) a přehled novinek s náhledy (MATE, Cinnamon). Linux Mint 18.1 bude podporován až do roku 2021.

Ladislav Hagara | Komentářů: 0
1.12. 16:42 | Nová verze

Byl vydán Devuan Jessie 1.0 Beta 2. Jedná se o druhou beta verzi forku Debianu bez systemd představeného v listopadu 2014 (zprávička). První beta verze byla vydána v dubnu letošního roku (zprávička). Jedna z posledních přednášek věnovaných Devuanu proběhla v listopadu na konferenci FSCONS 2016 (YouTube, pdf).

Ladislav Hagara | Komentářů: 0
Kolik máte dat ve svém domovském adresáři na svém primárním osobním počítači?
 (32%)
 (24%)
 (29%)
 (7%)
 (5%)
 (3%)
Celkem 767 hlasů
 Komentářů: 50, poslední 29.11. 15:50
Rozcestník
Reklama

Dotaz: python - hlavička emailu

22.10.2015 08:10 Milan Uhrák | skóre: 25 | blog: milan_at_ABC
python - hlavička emailu
Přečteno: 438×
Zdravím,

snažím se během zálohování emailů vytvořit jakousi databázi té zálohy. K tomu potřebuji každý soubor s el. poštou analyzovat a vybrat hlavičky, které mne zajímají.

zkusil jsem to nejprve v bash přes reformime .. což o to, hlavičky mi to vracelo, ale cat | reformime .... 4x se stejným souborem kvůli čtyřem hlavičkám mi přijde neefektivní ( emailů je kolem 180 GB ). Navíc jsem musel hlavičky stejně ošetřit pythonem (dekódovat).

Zkusil jsem tedy načtení hlaviček napsat kompletně v Pythonu. Python má nějaké rozšíření mail, ale nepřišel jsem mu na kloub, a způsoben, jakým jsem s ho snažil použít mi stále vyhazoval exceptions u dekódování "To :" ( tak jeden z 50-ti emailů mu neseděl .. ono to zlobilo i s tím reformime a následným dekódováním) ..

Tady chci představit mou práci (jsem pořád začátečník) požádat o korekce příp navrhnout jinou cestu.

předem díky.

Toto je jen funkce, která vytáhne hlavičky. na vzorku emailů se to chovalo korektně, ale možná narazím na nějaké exotické emaily, kde bude výsledek horší.

Funkce je lehce přizpůsobená z mail.headers (kde problém dělal použitý regulární výraz, jak jsem zjistil ) - regulární výraz je hahrazen otrockou smyčkou ..

def getheaders ( file_handler ):
	headers={}
	needed_headers = ["From: ", "To: ", "Subject: ", "Date: "]
	we_read = False
	for mail_line in file_handler:
		if ( we_read == True ):
			if( mail_line.startswith(' ') ):
				cur_header += " "+mail_line.strip();
			else:
				headers[h] = cur_header[len(h):]
				needed_headers.remove(h)
				we_read = False
		if ( we_read == False ):		
			for h in needed_headers:
				if( mail_line.startswith( h ) ):
					cur_header=mail_line.strip()
					we_read = True
					break
		if( len(needed_headers) == 0 ):
			break
	#print "headers - TO: "
	#print headers["To: "]
	return headers

Odpovědi

mika-talvinen avatar 22.10.2015 11:35 mika-talvinen | skóre: 23 | Plzeň
Rozbalit Rozbalit vše Re: python - hlavička emailu
Používat tuhle, jak říkáte otrockou smyčku, tomu bych se vyhnul. Tipoval bych, že zrovna v tomhle bude problém a jeden z X emailů neprojde.

Našel jsem ovšem tohle a k tomu dokumentaci. Jak je zde psáno: The email package provides a standard parser that understands most email document structures. To by mohlo být řešení pro vás. Nicméně jsem emaily parsovat nezkoušel, pouze vytvářet pomocí tohoto modulu. Tímto byste dostal objekt Message, kde se díky implementované __getitem__ metodě dá dostat k headers jako ke slovníku.
22.10.2015 13:24 Milan Uhrák | skóre: 25 | blog: milan_at_ABC
Rozbalit Rozbalit vše Re: python - hlavička emailu
aha .. no vídíte,

já prvně používal email.header na už (reformime) vykousané hlavičky, a tam mne to zlobilo. Moje předvedené řešení zatím funguje. problém byl v tom, že email.header nebokázal tím regexpem co má v sobě správně roztrhat některé "To: " položky.

Liskám to v Py 2.7 (prozatím) na serveru jsem novější verzi doposud nepotřeboval.

našel jsem si konkrétní zprávy, které způsobovaly problém a testuju to hlavně na nich. tak to ještě zkusím s tím vašim návrhem.

Jinak děkuji za námět.
26.10.2015 13:40 Milan Uhrák | skóre: 25 | blog: milan_at_ABC
Rozbalit Rozbalit vše Re: python - hlavička emailu
Takže prozatím ( plno práce okolo ) jsem dospěl k tomuto návrhu, ale bohužel, ani toto neparsuje pole adresátů u mnoha emailů správně. Nebudu se v tom pořád hrabat, původní řešení bylo funkční - i když "otrocké", tak to nebudu měnit.

Řešení je pro PY 2.7, pokud by někdo chtěl s tímto zápasit ..
def get_headers2( file_handler ):
	headers={}
	needed_headers = ["From", "To", "Subject", "Date"]
	msg = email.message_from_file( file_handler )
	for h in needed_headers:
		curr_header = email.header.decode_header( msg.get( h ) )
		header_sections = [unicode(text, charset or 'ASCII', "ignore") for text, charset in curr_header ]
		headers[ h ] = u"".join(header_sections)
	mail_date = msg.get( "Date" )
	if ( mail_date ):
		tup_date = email.utils.parsedate_tz( mail_date )
		if ( tup_date ):
			ts_date = email.utils.mktime_tz( tup_date )
			if ( ts_date ):
				mail_date = datetime.datetime.fromtimestamp( ts_date ).strftime( '%Y-%m-%d %H:%M:%S' )
	headers[ 'Date' ] = mail_date
	return headers

Zpracování datumu je tam odbyté, ale nepotřebuji na sekundu přesně čas, tak jsem to víc neřešil..
24.10.2015 09:43 Snow
Rozbalit Rozbalit vše Re: python - hlavička emailu
fuj to tvoje formátování kodu je víc než ohavné.
26.10.2015 13:40 Milan Uhrák | skóre: 25 | blog: milan_at_ABC
Rozbalit Rozbalit vše Re: python - hlavička emailu
ulevilo se ti ?
27.10.2015 13:01 fi
Rozbalit Rozbalit vše notmuch
Nehodilo by se vam pouzit toto na spravu metadat o emailech: https://notmuchmail.org/ a pak si to napsat treba v shellu?
4.11.2015 07:18 Milan Uhrák | skóre: 25 | blog: milan_at_ABC
Rozbalit Rozbalit vše Re: notmuch
děkuji, je to zajímavý kanón ... ale ten pythonský kód už vlastně funguje (ale člověk jen zírá, co vše "dokáži" zprasit tzv. email programy - od neskutečných popisů datumu, přes neuvedení charsetu v jiných polích ... Čas odeslání ale v kreativitě vede. ) a drobná škobrtnutí jsou ošetřena dostatečně. Netvořím systém pro další databázové zpracování, ale zase se párkrát stane, že někdo hledá starý smazaný email, a tento výcuc metadat by měl pomoct (dříve, než archiv rozbalím ) určit, jestli má cenu to rozbalovat.

Tohle je krátký, svižný - byť jednoúčelový - kód, který již dělá, co má.

Založit nové vláknoNahoru

Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

ISSN 1214-1267   www.czech-server.cz
© 1999-2015 Nitemedia s. r. o. Všechna práva vyhrazena.