MySQL ORDER BY RAND() a výkon

Potíž je v tom, že MySQL si napřed vygeneruje ke každému řádku náhodné číslo, pak řádky podle tohoto čísla seřadí a nakonec veme ten první. Takže si potřebuje udělat dočasnou tabulku, která pojme všechny řádky ve zdrojové tabulce (tedy alespoň ta náhodná čísla), tu pak seřadit a nakonec zahodit, protože je potřeba jen jeden řádek.

Pokud chceš jen jeden náhodný řádek, dej RAND() * (SELECT COUNT(*)) do offsetu v LIMIT.

Pokud chceš řádků více, je to trochu těžší. Pro několik málo řádků prostě volej jednořádkovou variantu kolikrát potřebuješ. Pro hodně řádků, pokud máš jako primární klíč celá čísla, můžeš vygenerovat seznam náhodných ID a pak si o ně říct. Pokud jsou ID děravá, tak to spustíš vícekrát, dokud nedostaneš požadovaný počet (můžeš ID vygenerovat pár navíc aby jsi omezil počet dotazů).

Hello world ! Segmentation fault (core dumped)

11.10.2012 15:19 AraxoN | skóre: 47 | blog: slon_v_porcelane | Košice
Rozbalit Rozbalit vše Re: MySQL ORDER BY RAND() a výkon

Možno to platí len pre postgresql, ale výhodnejšie je ORDER BY RANDOM(), než OFFSET RANDOM() * SELECT COUNT():

EXPLAIN SELECT * FROM test ORDER BY RANDOM() LIMIT 1;
                                     QUERY PLAN
-------------------------------------------------------------------------------------
 Limit  (cost=19755.35..19755.36 rows=1 width=1162)
   ->  Sort  (cost=19755.35..20165.12 rows=163906 width=1162)
         Sort Key: (random())
         ->  Seq Scan on test  (cost=0.00..18935.83 rows=163906 width=1162)
(4 rows)

EXPLAIN SELECT * FROM test LIMIT 1 OFFSET RANDOM()*(SELECT COUNT(*) FROM test);
                                     QUERY PLAN
------------------------------------------------------------------------------------
 Limit  (cost=20788.49..20788.60 rows=1 width=1162)
   InitPlan 1 (returns $0)
     ->  Aggregate  (cost=18935.83..18935.84 rows=1 width=0)
           ->  Seq Scan on test  (cost=0.00..18526.06 rows=163906 width=0)
   ->  Seq Scan on test  (cost=0.00..18526.06 rows=163906 width=1162)
(5 rows)

Cost prvej možnosti je nižší než druhej.

11.10.2012 16:33 Šangala | skóre: 56 | blog: Dutá Vrba - Wally
Rozbalit Rozbalit vše Re: MySQL ORDER BY RAND() a výkon

Záleží na tom jak moc je efektivní 'COUNT(*)' a nad jak velkými daty se to dělá.
U mě na MySQL (InnoDB i MyISAM) nad tabulkou s několika záznamy je ekvivalent druhého zápisu také rychlejší, ale s např. 180000 záznamy už ne (použil jsem co jsem měl po ruce - proto to číslo), ale celé je to o tom, že nejdéle trvá 'SELECT COUNT(*)…', pokud tedy budu losovat několik záznamů tak už je to diametrálně jiné, samozřejmě se ale nesmí použít ten uvedený druhý zápis, ale uložení si COUNT(*).
Čísla na 180 000 záznamech:

InnoDB: 0.21sec (získání COUNT(*) z toho 0.16 sec)   vs.   0.29sec 
MyISAM: 0.08sec (získání COUNT(*) z toho 0.05 sec)   vs.   0.18sec

To, že trpíš stihomamem, ještě neznamená, že po tobě nejdou. ⰞⰏⰉⰓⰀⰜⰉ ⰗⰞⰅⰜⰘ ⰈⰅⰏⰉ ⰒⰑⰎⰉⰁⰕⰅ ⰏⰉ ⰒⰓⰄⰅⰎ ·:⁖⁘⁙†

15.10.2012 16:04 Heron | skóre: 53 | blog: root_at_heron | Olomouc
Rozbalit Rozbalit vše Re: MySQL ORDER BY RAND() a výkon

U MVCC databáze (tedy asi všechno krom MyISAM) je COUNT(*) velmi drahá operace. Musí se spočítat řádky platné v dané transakci.

Heron

11.10.2012 18:13 okbob | skóre: 30 | blog: systemakuv_blog | Benešov
Rozbalit Rozbalit vše Re: MySQL ORDER BY RAND() a výkon

cost je hausnumero, to ještě nic nemusí znamenat - v každém případku použití ORDER BY RANDOM vede na sekvenční scan, což u velkých tabulek může být brzda - a tuplem, když je takový dotaz častý - pro tabulky do několikaseti řádků je to jedno, ale pak už to může zabolet. Viděl jsem server, kde významnou část zátěže produkoval podobný a pro většinu aplikací naprosto zbytný dotaz.

15.10.2012 16:01 Heron | skóre: 53 | blog: root_at_heron | Olomouc
Rozbalit Rozbalit vše Re: MySQL ORDER BY RAND() a výkon

Ale v každém případě se provádí sekvenční scan celé tabulky a v tom druhém případě dokonce dvakrát. Pro normálně velké tabulky ten server tímto efektivně odstavíte.

Heron

Dotaz: MySQL ORDER BY RAND() a výkon

Odpovědi