Hrátky s exif tagy

Přihlášení | Registrace

napište » Zprávičky

dnes 17:00 | IT novinky

Společnost Seznam.cz spouští konverzační nástroj založený na umělé inteligenci Seznam Asistent. Asistent využívá vlastní jazykový model SeLLMa a dočasně i komerční modely od OpenAI provozované v evropských datacentrech prostřednictvím Microsoft Azure. Dlouhodobým cílem Seznamu je provozovat Asistenta výhradně na interních jazykových modelech a ve vlastních datových centrech.

Ladislav Hagara | Komentářů: 0

LibrePods, sluchátka AirPods s Androidem a Linuxem

dnes 11:55 | Zajímavý software

Software LibrePods osvobozuje bezdrátová sluchátka AirPods z ekosystému Applu. Exkluzivní funkce AirPods umožňuje využívat na Androidu a Linuxu. Díky zdokumentování proprietárního protokolu AAP (Apple Accessory Protocol).

Ladislav Hagara | Komentářů: 0

AlmaLinux OS 10.1

dnes 05:00 | Nová verze

Byl vydán AlmaLinux OS 10.1 s kódovým názvem Heliotrope Lion. S podporou Btrfs. Podrobnosti v poznámkách k vydání.

Ladislav Hagara | Komentářů: 0

Služba Mozilla Monitor Plus bude 17. prosince ukončena

dnes 04:33 | Komunita

Placená služba prohledávání zprostředkovatelů dat a automatického odstraňování uniklých osobních údajů Mozilla Monitor Plus bude 17. prosince ukončena. Bezplatná monitorovací služba Mozilla Monitor bude i nadále poskytovat okamžitá upozornění a podrobné pokyny k omezení rizik úniku dat. Služba Mozilla Monitor Plus byla představena v únoru loňského roku.

Ladislav Hagara | Komentářů: 0

Waydroid 1.6.0

včera 22:44 | Nová verze

Waydroid (Wikipedie, GitHub) byl vydán v nové verzi 1.6.0. Waydroid umožňuje spouštět aplikace pro Android na běžných linuxových distribucích. Běhové prostředí vychází z LineageOS.

Ladislav Hagara | Komentářů: 1

Raspberry Pi Imager 2.0

včera 15:44 | Nová verze

Příspěvek na blogu Raspberry Pi představuje novou kompletně přepracovanou verzi 2.0 aplikace Raspberry Pi Imager (YouTube) pro stažení, nakonfigurování a zapsání obrazu operačního systému pro Raspberry Pi na SD kartu. Z novinek lze vypíchnout volitelnou konfiguraci Raspberry Pi Connect.

Ladislav Hagara | Komentářů: 2

Memtest86+ 8.00

včera 11:22 | Nová verze

Memtest86+ (Wikipedie), svobodný nástroj pro kontrolu operační paměti, byl vydán ve verzi 8.00. Přináší podporu nejnovějších procesorů Intel a AMD nebo také tmavý režim.

Ladislav Hagara | Komentářů: 0

Racket 9.0

včera 10:55 | Nová verze

Programovací jazyk Racket (Wikipedie), tj. jazyk z rodiny jazyků Lisp a potomek jazyka Scheme, byl vydán v nové major verzi 9.0. Hlavní novinku jsou paralelní vlákna (Parallel Threads).

Ladislav Hagara | Komentářů: 0

Arduino ke změnám podmínek používání a zásad ochrany osobních údajů

včera 10:11 | Komunita

Před šesti týdny bylo oznámeno, že Qualcomm kupuje Arduino. Minulý týden byly na stránkách Arduina aktualizovány podmínky používání a zásady ochrany osobních údajů. Objevily se obavy, že by otevřená povaha Arduina mohla být ohrožena. Arduino ubezpečuje, že se nic nemění a například omezení reverzního inženýrství v podmínkách používání se týká pouze SaaS cloudové aplikace.

Ladislav Hagara | Komentářů: 0

libpng 1.6.51 opravuje 4 bezpečnostní chyby

23.11. 13:33 | Bezpečnostní upozornění

Knihovna libpng, tj. oficiální referenční knihovna grafického formátu PNG (Portable Network Graphics), byla vydána ve verzi 1.6.51. Opraveny jsou 4 bezpečnostní chyby obsaženy ve verzích 1.6.0 (vydána 14. února 2013) až 1.6.50. Nejvážnější z chyb CVE-2025-65018 může vést ke spuštění libovolného kódu.

Ladislav Hagara | Komentářů: 12

Centrum | Napsat | Starší

navrhněte » Anketa

Jaké řešení používáte k vývoji / práci?

Github (35%)

Gitlab (46%)

Atlassian (19%)

Bitbucket (18%)

Gitea (22%)

Mercurial (15%)

jen git (23%)

jen svn (16%)

Jiné (uvedu v diskusi) (17%)

Celkem 397 hlasů

Komentářů: 17, poslední 19.11. 21:57

Rozcestník

AbcLinuxu

HDmag.cz

Aleš Kapica - kenyho_stesky

Aktuální zápisy

? Archív

? Navigace

Nej blogů na AbcLinuxu

Nejčtenější za poslední měsíc

Nejkomentovanější za poslední měsíc

AbcLinuxu:/ Blogy / kenyho_stesky / Za vším hledej Linux / Hrátky s exif tagy - popáté

Štítky: ATD, bez, CSV, data, etc, exif, exiftool, For, Geeqie, GIMP, grafika, HTML, LibreOffice, Mate, NAS, nevi, obsah, popis, přehled, screenshot, tom, úmrtí, vytvořil, web, zaznam, zen, Zpřístupnění

Hrátky s exif tagy - popáté

8.1.2020 18:26 | Přečteno: 3476× | Za vším hledej Linux | Výběrový blog

Hm. Takže. Pro většinů laiků je využití exif tagů zcela mimo rámec jejich chápání. Takže když jim řeknete, že je lepší popis fotografie ukládat rovnou DO souboru s obrázkem, obvykle zůstanou čumět jak vlaštovky na drát. Je-li to i váš případ, asi nemá cenu abyste četli dál. Pokud ale potřebujete operativně přehazovat informace, které se časem mohou stát klíčové, pak se vám může moje know-how hodit.

Tip pro sklerotiky…

Mezi nástroje, bez kterých bych nedal ani ránu, patří xfce4-screenshoter (který mám namapovaný na klávesu Application) a Geeqie, který používám k editaci EXIF tagů o kterých jsem zde v rámci svého blogu publikoval více již před víc jak 11 lety. Viz

Když se objeví v některém z terminálů či oken na mé obrazovce informace, na jejíž prostudování zrovna nemám čas, stačí udělat screenshot a prostřednictvím geeqie do komentáře vložit URL a případně vložit i kus textu, který mě zajímá. Kdykoliv se pak mohu k této informaci vrátit a mám k dispozici nejenom údaje o tom co to je, ale i časové razítko kdy byl screenshot pořízen – ať už je mezi tím soubor se screenshotem přejmenován, přesunut nebo ořezán. Neztratí se, pokud je screenshot zpracován přes Gimp a uložen ve formátu co podporuje exif tagy.

Takto uloženou informaci lze klidně vyhodit z hlavy a kdykoliv se k ní, v případě potřeby, vrátit.

Využívám toho ale nejenom při práci.

Do pestré palety mých zájmů totiž patří také hrabání se v historii. To je pochopitelně spojeno se shromaďováním nejrůzmějších snímků, skenů a jiných elektronicky zpracovaných dokumentů, které jsou bez informace o původu zcela bezcenné. Ovšem pokud jsou tyhle informace v exif komentáři, lze s nimi dál pracovat. A tím se dostávám k impulsu, který mne přiměl k sepsání tohoto blogpostu.

Před nějakým časem jsem se začal hrabat v digitalizovaných matrikách a tím se dostal k otázce, jak to udělat, abych nemusel jejich obsah opakovaně luštit a případně ho mohl dále zpracovávat už v nějaké rozumné formě.

Něco málo o matrikách…

Nevím kdo z vás se zajímá o genealogii, proto si neodpustím alespoň letmý úvod do problematiky.

Matriky, jsou úřední seznamy osob, ve kterých se evidují základní informace o narození, úmrtí a sňatku. Ale nejsou s námi odjakživa, takže počítejte s tím, že se při pátrání po svém původu v drtivé většině případů dostanete maximálně 10 generací zpátky. Jen pro zajímavost – od Ježíšových vrstevníků nás nedělí (mým letmým odhadem) víc než 70 generací.

Až na výjimky se u nás matriky začaly vést až v průběhu 17. století, po 30 leté válce. Jelikož předtím žádná evidence obyvatelstva nebyla, nikdo neví kolik lidí během ní vlastně zařvalo. Odhaduje se, že počet obyvatel v Evropě klesl v důsledku válečných útrap na polovinu, takže počátek evidence obyvatelstva byl nejspíš vyvolán potřebou zjistit, kdo tu válku vlastně přežil.

O matriky se původně starala církev. Mělo to svou logiku, kdo jiný než místní páter měl přehled o tom co se kde šustne. Byl u zdroje informací. V kostele se oznamovalo kdy a s kým se kdo hodlá oženit. Kostelem projela na poslední cestě většina nebožtíků a v kostele byli také pokřtěni. Bordel do toho vnesla až sekularizace 20 století, poté co tuhle agendu převzaly obecní úřady. O dnešní době informačního temna ani nemluvě.

K digitalizaci matrik Opavského archívu, ve kterých se hrabu já, došlo roce 2012 a možná vás, stejně jako mne, překvapí, že ji komplet zaplatili mormoni.

Jenže pouhá digitalizace ke zpřístupnění informací nestačí. To s čím se budete při čtení matrik potýkat nejvíc, je čtení prasopisu – a garantuji vám, že na tohle ještě hodně dlouho žádná umělá inteligence mít nebude.

Já to dávám jakž takž. Vždycky mne bavilo luštění klikyháků, takže toho mám docela dost načteno. Navíc texty v matrikách nejsou v zásadě nic složitého. Stačí když máte kromě češtiny nějaké ty znalosti němčiny a latiny. Také se většina textu často opakuje ale i tak je nutné mít bohaté zkušenosti a notnou dávku fantazie. Kupř. jen mé příjmení lze nalézt zapsáno a zkomoleno hned v několika podobách: Kapica, Kapitza, Kapicza, Kubitza, Pawlitza, & etc. Takže z ryze praktických důvodů jsem si začal psát přeluštěné texty rovnou do exif komentářů stažených skenů.

Ovšem aby se z těch jednotlivých záznamů daly dešifrovat konkrétní data je třeba nalézt vzájemné souvislosti. Obzvláště u žen, v matrikách z konce 17. století, kde se ještě nepsaly tzv. vývody, je k jednoznačné identifikaci nutné najít záznam o sňatku, ze kterého lze zjistit rodné jméno – teprve pak máte šanci zjistit kdy, kde a komu se konkrétní osoba narodila.

Typický záznam o narození vypadá takto: "Dne DD.MM.YYYY se narodila Jana, Jan Novák a Anna z XXX".

Je třeba najít záznam o sňatku. Jenže kdy se Novákovi vzali, a kde? Můžete zkusit postupně vyhledat všechny potomky. Jenže je Anna pokaždé jedna a táž osoba? Co když to byla druhá žena a první žena se také jmenovala Anna? Nezbývá než najít záznam o úmrtí. Jenže co když její manžel zemřel dříve a ona se mezi tím znovu vdala? Nebo co když umřela jinde? Atd. atd.

K tomu abyste snáze a rychleji našli vzájemné souvislosti, je optimální mít ty záznamy ve formě, kterou lze dále softwarově zpracovat. Tím se tedy konečně dostávám k věci.

exiftool

Aby bylo možné záznamy třídit, bylo nutné sjednotit jejich formu tak, aby je bylo možné obsah exif tagu importovat do tabulkového procesoru. Jenže kdybych měl postupně editovat sken po skenu, tak bych se z toho asi zbláznil. Takže jsem nejprve vytvořil jednoduchý html soubor s vloženými tabulkami:

user@stroj~/matriky$ echo '<!DOCTYPE html><html lang="cs"><head><meta charset="utf-8" /><title>matriky</title></head><body>' > tabulka.html
user@stroj~/matriky$ for i in $(ls -1 *.jpg) ; do exiftool -h -FileName -Caption-Abstract $i >> tabulka.html ; done
user@stroj~/matriky$ echo '</body></html>' >> tabulka.html

Ten jsem naimportoval do tabulky v Libreoffice a následně uložil jako csv soubor. Sjednocení obsahu v rámci jednoho textového souboru je mnohem rychlejší, než editovat tabulku buňku po buňce, či snad editovat obrázek po obrázku.

A jak dostat data zpátky do souborů?

U csv souboru je to brnkačka. Stačí ho přežvýkat shellovým skriptem. Názvy souborů jsou v tabulce a oddělovače pro obsah, co se má pomocí exiftool vložit do komentáře se při tom nahradí HTML entitami.

Hodnocení: 80 %

špatné • dobré

Tiskni Sdílej:

Komentáře

Nástroje: Začni sledovat (1) ? , Tisk

Vložit další komentář

9.1.2020 00:38 Josef Kufner | skóre: 70
Rozbalit Rozbalit vše Re: Hrátky s exif tagy - popáté

Odpovědět | Sbalit | Link | Blokovat | Admin

Nebylo by lepší na toto použít nějaké PDF nebo něco takového a přidat to tam jako vrstvu, kde by se psalo rovnou na místo se jménem?

Hello world ! Segmentation fault (core dumped)

9.1.2020 00:56 Aleš Kapica | skóre: 52 | blog: kenyho_stesky | Ostrava
Rozbalit Rozbalit vše Re: Hrátky s exif tagy - popáté

PDF? WTF?

Já si práci snažím maximálně zjednodušovat, ne komplikovat. Pokud zkusíte kliknout na ten link s ukázkou prasopisu, tak si můžete všimnout, že lze odkazovanou stránku stáhnout a uložit pod unikátním názvem, který se ovšem liší matrika od matriky. Bohužel úzus pro jména není zrovna optimální z hlediska třídění, ale nešť. Opavská implementace, je ve srovnání se všemi ostatními archívy nejpoužitelnější. Jinde kupř. evidentně nepochopili, že pokud si nemůže badatel ten sken stáhnout, aby s ním mohl dále pracovat, tak tím jenom komplikují další zpracování. Naštěstí mohu v takovém případě použít alespoň fintu se screenshotem (viz výše).

Pracovat s PDF je utrpení a křeč. Oproti tomu jpeg umí zobrazit kde co. A taky mohu obrázek ořezat, či jinak upravit, aby neobsahoval to co není nutné. Pokud bych nutně toužil po textové vrstvě, tak raději sáhnu po DjVu, které mi umožňuje přidat nejenom vrstvu v originále, ale i překlad a to vše mít v mnohem menším souboru, se kterým se mnohem líp pracuje než s PDF. Bohužel jen velmi málo lidí v téhle zemi pochopilo, proč se PDF jmenuje PDF.

9.1.2020 13:27 Max | skóre: 72 | blog: Max_Devaine
Rozbalit Rozbalit vše Re: Hrátky s exif tagy - popáté

Odpovědět | Sbalit | Link | Blokovat | Admin

Určitě zajímavý koníček, ale mně by to nebavilo a ani bych na to neměl skill (do nekonečna pročítat knihy, které bych neuměl ani přečíst, a to nemluvě ani o těch v jiných zemích).
Všechna čest, já na to dlabu :D.
Zdar Max

Měl jsem sen ... :(

9.1.2020 15:20 vencour | skóre: 56 | blog: Tady je Vencourovo | Praha+západní Čechy
Rozbalit Rozbalit vše Re: Hrátky s exif tagy - popáté

Odpovědět | Sbalit | Link | Blokovat | Admin

Dík.
Přidal jsem do výběru.

Ty nejhlubší objevy nečekají nutně za příští hvězdou. Jsou uvnitř nás utkány do vláken, která nás spojují, nás všechny.

9.1.2020 16:54 Semo | skóre: 45 | blog: Semo
Rozbalit Rozbalit vše Re: Hrátky s exif tagy - popáté

Odpovědět | Sbalit | Link | Blokovat | Admin

for i in $(ls -1 *.jpg) ; do    ----->    for i in *.jpg; do

If you hold a Unix shell up to your ear, you can you hear the C.

15.1.2020 01:48 hermitek | skóre: 2
Rozbalit Rozbalit vše Re: Hrátky s exif tagy - popáté

Odpovědět | Sbalit | Link | Blokovat | Admin

Internetová genealogie mě zrovna taky docela baví... ale řešit přepis informací (jen) pomocí exif tagů mi připadá dost nevhodné. Doporučuju nainstalovat si nějaký genealogický software (tzn. GRAMPS), chvíli času strávit nad tím, jak jej efektivně používat a potom se naučit všechny údaje správně citovat. Jeho možnosti relevantního vyhledávání a exportu do vhodných formátů jsou určitě lepší, než řešit vše přes tagy samotných obrázků.

Založit nové vlákno • Nahoru

Píšeme jinde

ISSN 1214-1267 www.czech-server.cz

Redakce | Inzerce | Podmínky použití | Osobní údaje