跳到主要內容

Django 和 Python 操作 database 時的額外負擔

為了搞清楚 Django ORM 的效率瓶頸, 做了個簡單的測試, 每筆實驗只有跑個兩三次, 不過結果差不多。

SQL x 1, new object x N

從本機的資料庫取出大量資料 (>1m筆), 然後將結果寫入 /dev/null, 資料型別為 utf-8。結果如下:

methodtime (min / sec)memory (G)
MySQL client0'080.54
python client1'021.4
django client without using iterator17'395.x
django client using iterator3'161.7
django client using raw sql1'021.5

實驗細節說明:
  • Django 1.2, MySQL 5.0。
  • 用 time 測時間。
  • memory 是我用眼睛注意 htop 的數據。django client without using iterator 跑太久了, 只好邊玩猴子守城四代邊跑實驗, 最大值就沒抓準了。
    (2012-02-02 更新) 只需定時執行
    grep VmPeak /proc/PID/status | awk '{print $2}'
    就不用「辛苦」地邊玩遊戲邊抓數據了。年輕時不懂事, 了解一些系統知識差異真大。
  • MySQL client 的用法: mysql < my_select.sql > /dev/null。沒做 encoding 轉換。
  • python client 的操作內容只有從 utf-8 轉成 unicode (MySQLdb 做的) 再轉回 utf-8, 補個換行字元, 就寫入檔案。
  • django 會自動把 utf-8 轉成 unicode。django client 的操作和 python client 幾乎一樣。
從上面的結果可以看出, 資料大時還是用 raw SQL 較好, 時間差了兩倍。看來生成 Django 物件比生成 Python 物件貴了一些。

至於 python 花了 mysql client  8 倍的時間, 只好當作用 python 的必要成本。不知其它語言 (C++、Java、Ruby、PHP) 這方面的額外負擔有多大。

為了弄清楚時間花在那裡, 另外試了 java client 和不轉 utf-8 的情況:

methodtime (min / sec)memory (G)
python client1'021.4
python client without encoding and decoding0'43
java client (using mysql connector)0'511.1

看來轉換 utf-8 花了不少時間, 到是用 Java 也沒省下多少時間。有可能 python client 已幾乎都是 native code 了。

SQL x N, new object x N

我用 primary key (id = 1 ~ 100,000) 分別做 100,000 次操作取出 100,000 筆資料, 結果如下:

methodtime (min / sec)
django client1'26
django client using raw sql0'20
實驗細節說明:
  • django client 用 get(id=ID)。
  • raw sql 用 where id = ID。
用 ORM 花了四倍的時間。根據 time 的結果, 我猜 real - user - sys 大概就是 IO time, 而 django client 確實多花了大量的 user time (1'13 vs. 0'09)。上面的實驗 ORM 花了三倍時間, 這裡多出一倍的時間有可能是 ORM evaluation 或生成 Django 物件造成的。對照上個實驗 (evaluation x 1, new Django object x N), 看來問題比較可能出在生成 Django 物件。之前用 python 的經驗裡, 發覺產生大量資料的情況下, 生成 python 物件還挺貴的。 另外, 用一個 SQL 取回 100,000 筆資料的時間只要不到 1s, 相較於 ORM 的負擔, 下太多次 SQL 是更大的問題。若只是做 1,000 次操作, ORM 的額外負擔就不到 1s, 感覺還好。

相關討論

這篇提到取出「大量」資料時的解法,  可以拆成多個 SQL 分次用 primary key 取出。留言裡有提到不要用 slicing (即 MySQL 的 offset + limit), DBMS 會取出大量資料再丟掉 limit 量之外的資料, 效率很差。我以為 offset 會一次取到對的資料, 一開始跑實驗時用 offset 沒用 primary key, 結果瓶頸變 IO, 反而沒測出 ORM 的額外負擔。 上面提的作法可以解掉 memory 的問題。但若資料量更大, 要跑得更快時, 還是得用 raw SQL。
不過這也不表示資料量大就要用 raw SQL, 得看應用場合。若瓶頸在其它地方, 用 raw SQL 只會省掉整體的 1/10 時間, 用 ORM 也不壞, 方便日後維護。

留言

  1. 1. "至於 python 花了 mysql client 8 倍的時間, 只好當作用 python 的必要成本。

    If this is CPU bound, installing debug packages and using a profiler like 'oprofile' will give more insight.

    If CPU time is mostly spent on:
    utf8 -> UCS4 -> utf8
    it should be fairly apparent from the profiler call chain output.

    2. "memory 是我用眼睛注意 htop 的數據。"
    ... orz

    And people wonder why userspace system programming skills is useful?

    On a Linux desktop machine with the Gnome desktop environment, do this:

    yum -y install gnome-python2-libgtop2
    ipython

    In [1]: import subprocess
    In [2]: import gtop
    In [3]: p = subprocess.Popen(['my-test-program'])
    In [4]: gtop.proc_mem(p.pid)
    Out[4]: Struct { .resident = 557056, .rss = 557056, .rss_rlim = 1844674407370955
    1615, .share = 483328, .size = 103231488, .vsize = 103231488 }


    How to run 'strace' on the above ipython session and learn that gtop.proc_mem() is reading /proc/PID-XXX/statm is left as an exercise for the reader.

    回覆刪除
  2. Thanks! I'll try them tomorrow.

    Btw, I remember that system engineers have higher average salary than software engineers in USA. System engineers probably have higher values or are hard to be found. :)

    回覆刪除
  3. 不錯不錯, 現在可以直接看懂 Scott 的留言了。以前覺得很難懂的世界, 跨過來的感覺真好

    回覆刪除

張貼留言

這個網誌中的熱門文章

virtualbox 使用 USB 裝置

2012-12-16 更新 現在 (4.x 版) 似乎無需做任何設定, 只要有裝 Oracle VM VirtualBox Extension Pack, 在 VirtualBox 視窗右下角按 USB 的圖示, 再點目標裝置, 即可加入或移除該裝置 同一時間只有 host 或 guest 可擁有該裝置, 所以從 guest OS 移除, 相當於接回 host OS 目前 VirtualBox 只支援 USB 2.0 的插槽, 若偵測不到時, 注意一下是否為這個問題 有時拔拔插插, VirtualBox 會進入奇怪的狀態, 接上去 guest OS 無法連接且跳出 device is busy 的錯誤訊息。試看看拔除該裝置, 重開 guest OS (續上則) 若重開 guest OS 無效, 並且 host OS 已移除該裝置, VirtualBox 的 USB 清單卻仍顯示 "captured", 試看看拔除該裝置, 重開 host OS原文網路上搜一下, 比較多是 Ubuntu 當 host 的解法, 我的情況是 Win7 當 host, Ubuntu 當 guest。 這兩篇說明很詳細《Learn How to Set Up USB and Networking Options in VirtualBox》《幻影千瞳的部落格: VirtualBox 使用筆記(二):使用 USB 裝置》 現在的版本圖形介面很好用了, 不用像第二篇說的那樣用指令操作。這裡記下我的操作步驟: 關掉 guest OS 在 VirtualBox 選單, 選擇 guest OS -> Settings -> USB -> Enable USB 2.0 會出現訊息框, 說明要安裝 Oracle VM VirtualBox Extension Pack。下載後安裝它 host OS 插入 USB 隨身碟 在 VirtualBox 選單, 選擇 guest OS -> Settings -> USB, 點右邊有綠色 "+" 的 USB 頭的圖示, 選擇該 USB 隨身碟, 加入它的 filter 從 host OS 移除 USB 隨身碟 開啟 guest OS 插入 USB 隨身碟, 於是 guest OS 會自動偵測…

(C/C++ ) 如何在 Linux 上使用自行編譯的第三方函式庫

以使用 LevelDB 為例。 抓好並編好相關檔案,編譯方式見第三方函式庫附的說明:$ ls include/ # header files leveldb/ $ ls out-shared/libleveldb.so* # shared library out-shared/libleveldb.so@ out-shared/libleveldb.so.1@ out-shared/libleveldb.so.1.20* 下面的例子用 clang++ 編譯,這裡用到的參數和 g++ 一樣。 問題一:找不到 header$ clang++ sample.cpp sample.cpp:5:10: fatal error: 'leveldb/db.h' file not found #include "leveldb/db.h" ^ 1 error generated. 解法:用 -I 指定 header 位置 問題二:找不到 shared library$ clang++ sample.cpp -I include/ /tmp/sample-2e7dd8.o: In function `main': sample.cpp:(.text+0x1e): undefined reference to `leveldb::Options::Options()' sample.cpp:(.text+0x6f): undefined reference to `leveldb::DB::Open(leveldb::Options const&, std::string const&, leveldb::DB**)' sample.cpp:(.text+0x10c): undefined reference to `leveldb::Status::ToString() const' sample.cpp:(.text+0x7d0): undefined reference to `leveldb::Status::ToString() const' clang: error: linker command failed with exit code 1 (u…

解決 undefined symbol / reference

C++ 新手上路, 有錯還請幫忙指正。 基本觀念相較於 script language 或 Java 來說, C/C++ 有完整的「編譯 -> 連結 -> 執行」三個階段, 各階段都可能發生 undefined symbol。在解決惱人的 undefined symbol 前, 得先明白整個編譯流程: 編譯 .c / .cpp 為 .o (object file) 時, 需要提供 header 檔 (用到 gcc 參數 -I)。事實上, 在編譯單一檔案時, gcc/g++ 根本不在意真正的 symbol 是否存在, 反正有宣告它就信了, 所以有引對 header 即可。這也是可分散編譯的原因 (如 distcc ), 程式之間在編譯成 .o 檔時, 並沒有相依性。 用 linker (ld 或 gold) 將 *.o 連結成 dynamic library 或執行檔時, 需要提供要連結的 library (用到 gcc 參數 -L 指定目錄位置, 用 -l 指定要連什麼函式庫)。不同於前一步, 此時 symbol 一定要在。 執行的時候, 會再動態開啟 shared library 讀出 symbol。換句話說, 前一個步驟只是檢查是否有。檢查通過也連結成 executable 或 shared library 後, 若執行時對應的檔案不見了, 仍會在執行期間找不到 symbol。若位置沒設好, 可能需要用 LIB_LIBRARY_PATH 指定動態函式的位置, 但不建議這麼做, 最好在執行 linker 時就指定好位置。原因見《Why LD_LIBRARY_PATH is bad》。明白這點後, 就看 undefined symbol 發生在那個階段, 若是編 object file 時發生, 就是沒和編譯器說 header 檔在那, 記得用 -I 告訴它。若在 linking 時發生, 就要同時設好 -L 和 -l。不過難就難在要去那找 undefined symbol 的出處。 解決問題的流程首先是判斷 symbol 是不是自己用到的原始碼裡, 可配合 id-utils 找看看 (我是用 gj, 比較方便一點)。或是看有沒有 man page, 有 man page 的話, 裡面會記錄用到的 header 和該怎麼下連結參數。若在專案裡找不到, …