kika

Мне скорее для общего развития интересно, чем решить данную конкретную задачу.

From:

itman.livejournal.com

База данных медленно работает.

From:

сразу видно профессианала.

From:

"А Перл медленный, потому что интерпретируемый!"©

From:

itman.livejournal.com

А причем здесь Перл-то? База данных медленна по другим причинам.

From:

Организуем несколько деревьев. Одно — hostname → record(host). Другие — term → hostname. Джойны ручками, как и в ООП, разницы нет здесь в подходе к джойнам. В чём есть оптимизация сложности имплементации — это в возможности ленивого join'а тем же хаскелем, тобы не городить producers/consumers деревьев.

From:

term→hostname - это в данном случае speed→hostname ? А как мне тогда проапдейтить дерево, когда я скорость пересчитал? В классической культуре у меня из ноды таблицы сразу ссылка на ноду в дереве, я ее удаляю и вставляю заново с новой скоростью.

From:

Псевдокод:

updateDerivedTree(DerivedTree, Hostname, Speed, Speed) -> ok;
updateDerivedTree(DerivedTree, Hostname, OldSpeed, NewSpeed) ->
    transform(DerivedTree, fun(
      {Speed, Host, Counter} when Speed == OldSpeed, Counter == 1 -> remove;
      {Speed, Host, Counter} when Speed == OldSpeed -> {replace, {Speed, Host, Counter-1}};
      _ -> ignore
    end),
    TransformResult = transform(DerivedTree, fun(
      {Speed, Host, Counter} when Speed == NewSpeed -> {Speed, Host, Counter+1}
      _ -> ignore
    end),
    case TransformResult of
      found -> ok;
      notfound -> add(DerivedTree, {Speed, Host, 1})
    end).

From:

что делает transform/2 ? Обходит все дерево и прикладывает к каждой ноде fun?

From:

Вызывает двоичный поиск по ключу (ключ забыл явно вторым аргументом указать). O(logN). Когда найдёт ключ, то вызывает функцию, и осуществляет операцию, которая этой функцией была подсказана, и либо оставляет дерево в покое, либо трансформирует текущую ноду.

From:

А ключом у тебя в дереве является скорость? А то что половина хостов имеют скорость 0, никому не помешает?

From:

А в чём дело? Если они просто её "имеют" — то дерево не перестраивается и даже не читается, так как срабатывает short-cirquit в псевдокоде, первой же строчкой.

А если значения флуктуируют в очень небольшом промежутке, тогда всё зависит от способа организации этого bag'а: есть ли в нём возможность указать secondary key. В простейшем случае можно сделать двухуровневый set: на первом уровне ключём является скорость, на втором - хост. Экстраполируя, получаем API для бэгов произвольной глубины:

transform(MultiBag, Keys, TransF) -> Result
Types   MultiBag = gb_trees()
       Keys = [term()]
       TransF = fun(Entry) -> retain | {replace, Entry} | delete

Пример:

transform(…, [0, "localhost"], fun({0, "localhost", _Key}) -> retain end).

From:

Флуктуируют они в адском промежутке, конкретно скорость может колебаться от нуля до wire speed. Но идею я понял, спасибо.

From:

А если значения флуктуируют в очень небольшом промежутке

Фигню сморозил, конечно, очередной раз. Флуктуировать они могут как угодно, тут от степени флуктуации ничего не зависит.

From:

Тут на самом деле неприятнее то, что надо знать OldSpeed, который можно выудить только еще одним лукапом. Но это терпимый оверхед.

From:

O(logN), он и в африке O(logN), даже с большой константой. А учитывая то, что при использовании эрланга ты уже получаешь фактор ~3-10x от скорости C, плюс-минус два в середине очень короткого цикла не должно волновать ;)

From:

Ктоб ерлангу хороший компилятор написал...

From:

В случае решения на императивщине, сложность O(logN) на апдейтах.
В случае показанного выше решения — сложность O(logN) на апдейтах.

From:

я, может, не понимаю чего. а что мешает тебе точно так же держать, я не знаю, какое-нибудь purely functional tree? ну апдейты чуть подороже, там, O(log N), небось, вместо O(1) до ребалансировки; вроде бы не ужас-ужас?

From:

Да ничего не мешает, кроме O(logN) :-) Да и логарифм это, ключом в дереве же является скорость, а не имя, и чтобы выбросить старую скорость из дерева мне надо обежать его всё и найти в нем нужную ноду.

From:

ну не прям всё, ты же знаешь предыдущую скорость. but yeah, i get the idea.

From:

Ну да знаю. Раскручиваемся с нуля, у всех предыдущая скорость - ноль.

From:

это же всё никакого отношения не имеет к pure functional, те же проблемы с любым balanced tree у тебя? ну держи нули в отдельном листе, я не знаю? :) или, там, compound key придумай какой?

From:

да, правильное решение - composite key (speed, host_id). неуникальные индексы у всех нормальных баз так и устроены (clustered key неявно хранится не только в листьях, но и ветках).

From:

...а, ну да, no reverse link. ну не знаю.

From:

> запросы снаружи - типа а покажи-ка мне список хостов, отсортированных по пингу. Допустим, хостов у нас ровно один газиллион, поэтому сортировать на каждый запрос накладно.

мне кажется, ты чего-то не договариваешь. потому что если тебе надо отдать весь газиллион сразу, то сортировка является наименьшей из твоих проблем. а если тебе надо отдать top N, или устроить paging какой-нибудь, то это две разные задачи, которые оптимально могут решаться по-разному.

сбалансированные деревья тебе по-всякому пригодятся, если их ещё нет (зачем в структурах держать указатели на деревья, непонятно). но есть вопросы, которые могут усложнить рукописное. например, годится ли выдача с phantom rows? missing rows? duplicate rows? (я предполагаю, что данные у тебя апдейтятся параллельно с выполнением аналитических запросов, а не через global lock, который либо то, либо сё).

короче, если подобные вопросы не продуманы, или продуманы и есть подозрение, что будут проблемы, которые придётся решать, то лучше использовать rdbms, где их продумали и решили за тебя.

скорость/производительность: описанная задача, что в виде top N, что в виде paging, выполняется нормальной базой суб-миллисекундно, десяток тысяч раз в секунду.

From:

Да, реально задача отдать topN, где N произвольное, но заранее заданное число. С "нормальной базой" есть одна проблема - на нее нет вычислительного ресурса. Предмет обсуждения - это телеком appliance, живущий в 2U корпусе и чисто конкретно нагруженный своей работой, за которую ему денег платят. Если с процессором там более-менее (пока) свободно, то с памятью полный швах, хотя технически ее от 12Гб в entry level.

From:

define "полный швах" :)

вообще, sql server (нормальный, а не компакт) может нормально жить в довольно-таки тесных помещениях - например, 100 мегабайт памяти на всё про всё. зависит от задачи, конечно. rule of thumb is - если all non-leaf index pages влезают в память, то всё в порядке. сравни с самописным решением: в памяти надо держать индексы целиком, а не только их non-leaf части.

также: обязательно ли сервер базы должен бежать на том же самом ящике? round trip через один хоп - это тоже sub-millisecond.

From: