Portál AbcLinuxu, 12. května 2025 11:21

Dotaz: multiline sed? Najdi, porovnej a vymaž řádek

2.1.2015 22:42 JanM | skóre: 28
multiline sed? Najdi, porovnej a vymaž řádek
Přečteno: 458×
Odpovědět | Admin

Mám plain text:

                [Date.UTC(2014, 11, 23, 5, 12, 0, 0), 3],
                [Date.UTC(2014, 11, 23, 5, 14, 0, 0), 3],
                [Date.UTC(2014, 11, 23, 5, 16, 0, 0), 2],
                [Date.UTC(2014, 11, 23, 5, 18, 0, 0), 2],
                [Date.UTC(2014, 11, 23, 5, 20, 0, 0), 2],
                [Date.UTC(2014, 11, 23, 5, 22, 0, 0), 2],
                [Date.UTC(2014, 11, 23, 5, 24, 0, 0), 2],
                [Date.UTC(2014, 11, 23, 5, 26, 0, 0), 2],
                [Date.UTC(2014, 11, 23, 5, 28, 0, 0), 1],
                [Date.UTC(2014, 11, 23, 5, 30, 0, 0), 1],
                [Date.UTC(2014, 11, 23, 5, 32, 0, 0), 1],
                [Date.UTC(2014, 11, 23, 5, 34, 0, 0), 1],
                [Date.UTC(2014, 11, 23, 5, 36, 0, 0), 1],
                [Date.UTC(2014, 11, 23, 5, 38, 0, 0), 1],
                [Date.UTC(2014, 11, 23, 5, 40, 0, 0), 0],

A potřeboval bych odstranit řádky výše zvýrazněné kurzívou, aby to vypadalo takto:

                [Date.UTC(2014, 11, 23, 5, 12, 0, 0), 3],
                [Date.UTC(2014, 11, 23, 5, 14, 0, 0), 3],
                [Date.UTC(2014, 11, 23, 5, 16, 0, 0), 2],
                [Date.UTC(2014, 11, 23, 5, 26, 0, 0), 2],
                [Date.UTC(2014, 11, 23, 5, 28, 0, 0), 1],
                [Date.UTC(2014, 11, 23, 5, 38, 0, 0), 1],
                [Date.UTC(2014, 11, 23, 5, 40, 0, 0), 0],

Konkrétně potřebuji porovnávat poslední číselný údaj a v případě souvislého opakování ponechat pouze první a poslední záznam.

Dá se to relativně jednoduše zvládnout pomocí sed či awk? Pokud ne, asi bych to řešil mechanicky v bashi (načítání řádků, porovnávání hodnoty, vymazání nadbytečného řádku a pořád dokola, dokud bude co mazat).


Řešení dotazu:


Nástroje: Začni sledovat (2) ?Zašle upozornění na váš email při vložení nového komentáře.

Odpovědi

3.1.2015 01:16 pavele
Rozbalit Rozbalit vše Re: multiline sed? Najdi, porovnej a vymaž řádek
Odpovědět | | Sbalit | Link | Blokovat | Admin
Tedy v bashi bych to řešil primitvně, například:
cat soubor | sort -k8 -u -r >soubor1
tac soubor | sort -k8 -u -r >soubor2
#paste -d '\n' soubor1 soubor2 >vysledek
paste -d '\n' soubor1 soubor2 | uniq >vysledek
3.1.2015 13:55 JanM | skóre: 28
Rozbalit Rozbalit vše Re: multiline sed? Najdi, porovnej a vymaž řádek
To je trochu moc drastická metoda ;-)

On ten plain text má stovky kB a číselný údaj v posl. sloupci se pohybuje mezi 0 - 5, střídavě nahoru a dolu. "unique" to pročistí tak důkladně, že z těch stovek kB zbude pár řádků.
wamba avatar 3.1.2015 02:39 wamba | skóre: 38 | blog: wamba
Rozbalit Rozbalit vše Re: multiline sed? Najdi, porovnej a vymaž řádek
Odpovědět | | Sbalit | Link | Blokovat | Admin
napsáno "nehezky" pomocí Perl-u
perl -00 -pe 's/(\N* (\d+)\],\n).*\n(\N* \2\],\n)/$1$3/msg'
This would have been so hard to fix when you don't know that there is in fact an easy fix.
3.1.2015 18:14 JanM | skóre: 28
Rozbalit Rozbalit vše Re: multiline sed? Najdi, porovnej a vymaž řádek
Funguje na výše uvedený příklad, ale už ne obecně na velké množství dat. Pravda, to jsem v dotazu nezdůraznil.
Řešení 1× (JanM (tazatel))
wamba avatar 3.1.2015 19:41 wamba | skóre: 38 | blog: wamba
Rozbalit Rozbalit vše Re: multiline sed? Najdi, porovnej a vymaž řádek
tak třeba tohle by mohlo fungovat i na velké soubory
perl  -ne ' /(\d+)\],/; print $pred_radek if $1!=$pred or $pred2!=$pred; $pred2=$pred; $pred=$1; $pred_radek=$_'
vytiskni řádek jestli se předešlý nebo následující řádek liší v čísle před ],

Ps. samozřejmě by bylo přehlednější napsat Perl script než tento "one-liner"
This would have been so hard to fix when you don't know that there is in fact an easy fix.
5.1.2015 21:47 JanM | skóre: 28
Rozbalit Rozbalit vše Re: multiline sed? Najdi, porovnej a vymaž řádek
Pěkné. Pro úplnost jsem přidal jeden print, aby to vytisklo i první řádku souboru:
perl  -ne ' /(\d+)\],/; print if 1..1; print $pred_radek if $1!=$pred or $pred2!=$pred; $pred2=$pred; $pred=$1; $pred_radek=$_'
wamba avatar 5.1.2015 22:34 wamba | skóre: 38 | blog: wamba
Rozbalit Rozbalit vše Re: multiline sed? Najdi, porovnej a vymaž řádek
no ono ho to netiskne jen pokud na prvním řádek (resp. dvou) je 0], jinak ho to tiskne, tak bych spíš doporučoval něco jako:
perl  -ne 'BEGIN{$pred=-1}; /(\d+)\],/; print $pred_radek if $1!=$pred or $pred2!=$pred; $pred2=$pred; $pred=$1;$pred_radek=$_'
#
problém by ještě nastal kdyby "poslední" řádek nekončil \n, pak by se nevytiskl
This would have been so hard to fix when you don't know that there is in fact an easy fix.
Řešení 1× (JanM (tazatel))
3.1.2015 11:30 petris_ | skóre: 12
Rozbalit Rozbalit vše Re: multiline sed? Najdi, porovnej a vymaž řádek
Odpovědět | | Sbalit | Link | Blokovat | Admin
jj, jde to snadno

sed -re 'H;x;/([0-9]+)\].*\1\]/d'
3.1.2015 15:39 MilanK
Rozbalit Rozbalit vše Re: multiline sed? Najdi, porovnej a vymaž řádek
Funguje to skvěle, akorát to zduplikuje řádek, když se posl. údaj neopakuje (zvýrazněno kurzívou). To bych v nejhorším odstranil přes "uniq":
                [Date.UTC(2014, 11, 25, 10, 36, 36, 0), 1],
                [Date.UTC(2014, 11, 25, 10, 38, 38, 0), 1],
                [Date.UTC(2014, 11, 25, 10, 40, 40, 0), 1],
                [Date.UTC(2014, 11, 25, 10, 42, 42, 0), 1],
                [Date.UTC(2014, 11, 25, 10, 44, 44, 0), 0],
                [Date.UTC(2014, 11, 25, 10, 50, 50, 0), 0],
                [Date.UTC(2014, 11, 25, 10, 52, 52, 0), 1],
                [Date.UTC(2014, 11, 25, 10, 54, 54, 0), 0],
                [Date.UTC(2014, 11, 25, 15, 42, 42, 0), 0],
                [Date.UTC(2014, 11, 25, 15, 44, 44, 0), 1],
                [Date.UTC(2014, 11, 25, 15, 46, 46, 0), 3],
                [Date.UTC(2014, 11, 25, 10, 36, 36, 0), 1],
                [Date.UTC(2014, 11, 25, 10, 42, 42, 0), 1],
                [Date.UTC(2014, 11, 25, 10, 44, 44, 0), 0],
                [Date.UTC(2014, 11, 25, 10, 50, 50, 0), 0],
                [Date.UTC(2014, 11, 25, 10, 52, 52, 0), 1],
                [Date.UTC(2014, 11, 25, 10, 52, 52, 0), 1],
                [Date.UTC(2014, 11, 25, 10, 54, 54, 0), 0],
                [Date.UTC(2014, 11, 25, 15, 42, 42, 0), 0],
                [Date.UTC(2014, 11, 25, 15, 44, 44, 0), 1],
                [Date.UTC(2014, 11, 25, 15, 44, 44, 0), 1],
                [Date.UTC(2014, 11, 25, 15, 46, 46, 0), 3],

Založit nové vláknoNahoru

Tiskni Sdílej: Linkuj Jaggni to Vybrali.sme.sk Google Del.icio.us Facebook

ISSN 1214-1267, (c) 1999-2007 Stickfish s.r.o.