Jawapan ringkas: Pusat data AI ialah berketumpatan tinggi di mana kuasa, penyejukan, fabrik dan storan ditumpukan kepada model latihan dan penyajian, bukan bilik pelayan dengan GPU tambahan. Cip mendapat kemasyhuran; bangunan yang menentukan sama ada ia berfungsi. Jika imej tidak boleh keluar, pasang semula sel kecil; kebanyakan pasukan harus menyewa.
Kesimpulan utama:
Cip vs pembinaan: Kuasa, penyejukan, fabrik dan storan menentukan sama ada pemecut berfungsi.
Tempat bukan istana: Ubah suai dua rak apabila data tidak boleh dikeluarkan; jangan beli kampus.
Min vs median: Pada lapan larian, median hid dimulakan semula; gunakan min 18 jam.
Rintangan salah guna: Jangan sebut harga PUE untuk dua rak di dewan campuran.
Keputusan ilustrasi: Lapan larian adalah peta kecil, bukan penjimatan pengeluaran sebanyak 50%.

Artikel yang mungkin anda ingin baca selepas ini:
🔗 Adakah AI boleh dipercayai? Video dan kuiz
Terokai kebolehpercayaan AI melalui video yang menarik dan kuiz interaktif.
🔗 Cara menggunakan AI dalam kehidupan seharian
Temui cara praktikal AI dapat memudahkan tugas dan rutin harian.
🔗 Cara menggunakan AI di tempat kerja
Pelajari cara praktikal untuk menggunakan AI untuk produktiviti tempat kerja yang lebih pintar.
🔗 Bolehkah AI berfikir untuk dirinya sendiri?
Fahami sama ada kecerdasan buatan benar-benar boleh berfikir secara bebas atau menaakul.
Perbezaannya dengan pusat data "biasa"
Dewan tradisional mengoptimumkan untuk beban kerja campuran dan masa operasi merentasi banyak perkhidmatan kecil. Anda mengambil berat tentang redundansi, sudah tentu, dan tentang PUE sebagai satu konsep - tenaga tambahan yang digunakan oleh bangunan untuk menyampaikan satu watt pengkomputeran. Anda biasanya tidak mereka bentuk setiap koridor di sekeliling rak yang berkelakuan seperti ladang pemanas mudah alih.
Tapak AI mengubah nisbah. Ketumpatan meningkat. Rangkaian menjadi fabrik yang kerja latihan tidak boleh berjalan terhincut-hincut tanpanya. Storan perlu memastikan pusat pemeriksaan bergerak atau pemecut terbiar, seperti kuda lumba dalam kesesakan lalu lintas.
Terdapat juga perbezaan budaya. Pegawai perusahaan berfikir dalam tiket dan pertukaran tetingkap. Pegawai AI berfikir dalam barisan kerja dan rasa mual apabila nod mati lewat dalam jangka masa panjang. Saya rasa anda masih boleh menghubungi kedua-dua "pusat data" kerana memang begitu. Label itu hanya menyembunyikan paip.
| Jenis | Untuk apa ia dibina | Perkakasan yang menonjol | Kuasa / watak penyejukan | Siapa yang sesuai dengannya | Mengapa ia wujud |
|---|---|---|---|---|---|
| Pusat data perusahaan tradisional | IT Campuran: pangkalan data, VM, e-mel, fail | CPU, pelayan biasa, storan biasa | Dipandu udara; kepadatan sederhana; PUE sebagai bahan perbincangan | Syarikat yang menjalankan sistem harian | Pastikan aplikasi perniagaan sentiasa aktif |
| Kluster latihan AI | Kerja latihan yang panjang dan berkait rapat | Rak pemecut yang padat; Sambungan GPU | Ketumpatan tinggi; penyejukan cecair atau [penukar haba pintu belakang](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) | Makmal dan pembina model tinggal dalam barisan kerja | Tamatkan larian tanpa menghabiskan kerepek |
| Kemudahan inferens AI | Penyajian model; jawapan masa nyata dan kelompok | Pemecut; pengimbang beban yang penting | Masih hangat, cuma... kurang sandiwara; kependaman berbanding kepadatan kasar | Produk yang perlu dijawab sekarang | Letakkan model berhampiran pengguna |
| Dewan AI hibrid | Berlatih dan berkhidmat di bawah satu bumbung; agaknya | Rak campuran; kolam berpagar; fabrik kongsi | Dua personaliti yang menyejukkan dalam satu bilik tumbuhan;; ia menjadi janggal | Pasukan yang tidak mampu memiliki dua kampus | Modal terbatas; kehidupan tidak kemas |
Bukan kedudukan moral. Mesin berbeza, nama keluarga yang sama.
GPU, pemecut dan rak yang memakan kuasa
Berjalan di lantai tradisional yang dinaikkan dan rak-rak itu kelihatan hampir sopan. Berjalan di barisan AI dan ia kelihatan seperti mahu menelan bangunan itu.
Perkakasan yang menonjol bukanlah CPU yang pintar. Ia adalah dulang pemecut: GPU atau cip AI lain, yang dimasukkan ke dalam pelayan, kemudian rak, kemudian baris yang berkongsi fabrik jalur lebar tinggi. GPU menghubungkan cip jahitan menjadi sesuatu yang boleh berpura-pura menjadi satu pemecut gergasi; fabrik kluster melakukan helah yang sama pada skala baris. Latihan selari hanya berfungsi jika pautan tersebut kekal tebal dan boleh diramal. Jika itu hilang, "kluster" anda akan menjadi timbunan stesen kerja mahal yang berkongsi poskod.
Kuasa mengikut cip. Bukan PDU pejabat yang besar. Megawatt beban IT sebaik sahaja dewan penuh - saya tidak akan mereka-reka nombor. Ketumpatan setiap rak adalah kelainan plot. Rak yang lebih sedikit. Setiap satu adalah relau kecil. Faktor pengehad selalunya ialah pencawang, bukan senarai hajat GPU. Anda tahu bagaimana keadaannya: perolehan mahukan lebih banyak pemecut; utiliti mahukan perbualan yang panjang dan cek yang sangat besar.
Satu metafora yang agak bodoh yang tidak dapat saya tolak: rak itu ialah haiwan yang lapar. Anda boleh membiakkan yang lebih cepat. Anda masih perlu memberinya makan, dan anda masih perlu menghilangkan kepanasan. Abaikan mana-mana satu dan ia akan menjadi pemberat kertas yang sangat mahal.
Kuasa, haba dan masalah penyejukan
Elektrik masuk. Haba keluar. Itulah keseluruhan agama.
Rak berketumpatan tinggi membuang haba dengan cara udara tidak pernah diminta untuk mengendalikannya. Anda boleh menolak udara dengan lebih kuat - penukar haba pintu belakang, lorong yang lebih panas, pembendungan yang bijak - dan itu berkesan sehingga ke tahap tertentu. Kemudian cecair muncul:
-
Gelung penyejuk yang menjadikan bilik tumbuhan kelihatan seperti bahan kimia berfungsi
-
Penyerapan dalam beberapa reka bentuk, yang masih mengejutkan orang yang berpendapat air dan pelayan tidak sepatutnya berkongsi ayat
Semua ini tidak menarik. Semuanya adalah produknya, kerana pemecut yang memecut adalah pemecut yang telah anda bayar dan tidak boleh gunakan sepenuhnya.
PUE masih penting. Ia adalah nisbah, bukan personaliti. Operator mengejarnya kerana setiap watt yang dibelanjakan untuk kipas dan pam adalah watt yang tidak pergi ke GPU. Saya tidak akan memetik angka "tipikal"; iklim dan cara anda melukis sempadan menggerakkannya, dan ketepatan palsu adalah lebih teruk daripada tiada langsung. Air juga ada dalam cerita. Sesetengah tumbuhan menghirup. Ada yang menelan. Penyejukan penyejatan adalah cekap sehingga sungai atau kemarau menjadikannya bersifat politik.
Rangkaian: mengapa fabrik itu penting seperti cip
Orang ramai mengambil gambar GPU. Mereka sepatutnya mengambil gambar suis.
Latihan adalah satu perbualan. Beribu-ribu pemecut bertukar kecerunan, parameter, serpihan model, dalam penyegerakan yang ketat. Jika fabriknya bergegar, seluruh kerja menunggu pada lompatan paling perlahan. Itulah sebabnya AI terobsesi dengan rangkaian jalur lebar tinggi, kependaman rendah dan topologi yang tidak berlipat separuh apabila pautan gagal. Fabrik seakan-akan InfiniBand, Ethernet dalam peranan yang sama, GPU saling berhubung di dalam kotak, kabel yang mesti betul pada kali pertama.
Inferens adalah perbualan yang berbeza. Pelayanan model mementingkan kependaman ekor - jawapan yang perlahan, bukan jawapan biasa. Kelompok vs masa nyata membahagikan personaliti. Kluster latihan mahukan pergerakan yang padat, kolektif, dan menyeluruh. Armada pelayanan mahukan banyak permintaan yang lebih kecil dan pengasingan, tanpa kesesakan lalu lintas di pengimbang beban.
Cikgu, semasa saya di sini: orang ramai menganggap rangkaian itu sebagai paip dan kerepek sebagai restoran. Di bangunan ini, paip itu adalah restoran. Jika terlepas itu, anda akan membeli dapur yang tidak boleh menerima penghantaran.
Latihan vs inferens: dua bangunan, kadangkala secara literal
Latihan adalah satu kempen. Anda mengumpulkan kluster, memasukkan data ke dalamnya, memeriksanya secara teliti, menjalankannya selama berjam-jam atau berminggu-minggu, dan berdoa agar fabrik itu kekal lancar. Banyak kumpulan, dahagakan lebar jalur, sabar secara senyap - sehingga nod yang gagal mengambil kesempatan daripada larian tersebut. Satu pemecut yang mati dalam kerja yang digandingkan rapat boleh menghentikan keseluruhan korus.
Inferens ialah bahagian hadapan kedai. Model sudah terlatih, kini menjawab soalan, mengklasifikasikan imej, menjana teks. Kependaman penting. Pemecut yang sedikit lebih lama berhampiran pelanggan boleh mengatasi pemecut yang glamor di benua lain.
Jadi anda mendapat perpecahan. Kampus latihan mengejar kuasa, tanah dan kepadatan. Tapak inferens mengejar kependaman dan kehadiran. Dewan hibrid juga wujud, kerana modal tidak terbatas. Tidak semestinya dua bangunan. Kadangkala satu dewan dengan tali baldu dan dua gelung penyejuk.
Di sinilah juga kolokasi, kampus hiperskala dan fork on-prem. Hiperskala dibina pada skala yang membuatkan kita semua kelihatan seperti sedang menyusun perabot. Colos menjual kepadatan mengikut rak. On-prem masih berlaku apabila data tidak dapat dikeluarkan.
Daya pemprosesan storan, pusat pemeriksaan dan cip yang lapar
Tiada siapa yang meletakkan sistem fail selari di kulit brosur.
Data latihan perlu tiba cukup pantas supaya GPU tidak bertindak balas. Pusat pemeriksaan perlu mendarat supaya ranap sistem tidak membuang masa seminggu. Pemberat model perlu dimuatkan sebelum replika yang ditayangkan beroperasi. Daya pemprosesan storan - bukan sekadar kapasiti - adalah hambatan senyap. Anda boleh membelanjakan banyak wang untuk pemecut dan menghabiskannya dengan tatasusunan yang sopan yang direka bentuk untuk mesin maya.
Coraknya sudah biasa: kelompok yang berkilat, barisan kerja dan menunggu I/O yang merenung kembali seperti invois yang biadap. Mengklasifikasikan pengiraan tanpa mengklasifikasikan laluan data adalah cara anda mendapatkan masa terbiar yang sangat mahal. Pastikan cip terus diisi atau akui anda telah membeli arca.
Perisian, orkestrasi dan lapisan operasi yang tidak glamor
Perkakasan adalah selebriti. Penjadual melakukan kerja.
Pusat data AI tidak berguna jika tugas tidak dapat mencari GPU, jika dua pasukan tidak dapat berkongsi kluster tanpa pergaduhan, jika pangkat yang gagal tidak dapat diganti, jika firmware hanyut sehingga fabrik gagal dalam gerakan perlahan. Orkestrasi, kebolehcerapan, pengehadan kuasa - lapisan operasi yang tidak glamor, itulah cara anda tahu ia penting.
Saya mempunyai pandangan yang lemah terhadap lapisan ini. Juga apabila NIC yang salah konfigurasi menyamar sebagai masalah penyejukan untuk sepanjang petang... anda akan menemuinya dengan cara yang sukar.
Apabila nod mati pada pertengahan larian
Nod mati. Tetingkap perubahan masih bertembung dengan latihan yang tidak mempedulikan kalendar anda. Anda menjadualkan kerja besar secara berkumpulan, menutup kolam inferens, menulis buku larian untuk kegagalan yang kelihatan seperti "kerja perlahan" sehingga ia kelihatan seperti "kerja sudah mati." Redundansi masih penting - kuasa, penyejukan, laluan, storan - tetapi mod kegagalan kurang kemas berbanding slaid masa operasi sembilan yang lama. Inferens: replika, toskan nod sakit, teruskan menjawab. Latihan mahukan pusat pemeriksaan, bukan optimisme.
Lokasi, air, grid dan jiran tetangga
Anda tidak meletakkan salah satu daripada ini di sebelah pondok untuk pemandangan.
Sambungan grid selalunya merupakan proses pemilihan tapak yang sebenar. Tanah adalah mudah berbanding pencawang dan utiliti yang mempunyai pelanggan lain. Air untuk penyejukan, jika anda menggunakannya, menjadi isu jiran sebaik sahaja hujan turun dengan lebat. Bunyi bising. Pukal visual. Haba di pagar sempadan. Jawatankuasa perancangan menemui pendapat tentang "awan" sebaik sahaja ia memerlukan padang dan sungai.
Kependaman menarik ke arah yang lain. Inferens suka berada berhampiran pengguna dan saling berhubung. Latihan boleh bersembunyi di pasaran kuasa yang lebih murah dan iklim yang lebih sejuk. Industri bercakap seolah-olah terdapat satu tapak yang sempurna. Tidak ada. Terdapat kompromi dengan siaran akhbar.
Sisa haba dan relau yang tidak diundang
Brosur-brosur suka bahagian ini. Salurkan sisa kehangatan ke dalam rumah, kolam renang, rumah hijau; ia adalah ayat yang indah. Kadangkala gelung daerah itu tulen. Kadangkala kampus berada di tempat yang salah dan haba masih masuk ke udara. Saya ragu-ragu dengan versi brosur; saya tidak ragu-ragu dengan fiziknya.
Siapa yang memerlukannya (dan siapa yang patut menyewanya)
Kebanyakan orang tidak perlu memiliki salah satu dewan ini.
Senarai yang tumpul:
-
Penskala hiper, kerana produk tersebut adalah armada
-
Makmal, apabila masa giliran menjadi penghalang, atau data tidak dapat keluar
-
Bank, kumpulan hospital, kerajaan atau pengilang dengan set data rahsia - di premis atau sangkar colo persendirian boleh menjadi rasional, walaupun ia adalah satu kesalahan
Semua orang lain patut menyewa. Lokasi bersama dengan ketumpatan sedia AI. Tempahan awan. Kluster terurus. Anda mendapat pemecut tanpa perlu menjadi pengendali loji janakuasa. Percintaan itu pudar apabila pertama kali seseorang bertanya siapa yang bertugas untuk gelung penyejuk pada pukul 3 pagi.
Saya akui ada satu kebanggaan. Memiliki kluster itu terasa seperti memiliki alat ramalan. Kemudian invois elektrik tiba, dan pihak berkuasa duduk berteduh.
Untuk apa bangunan itu
Jadi, apakah itu Pusat Data AI? Sebuah kampus khusus yang berketumpatan tinggi di mana pemecut, kuasa, penyejukan, fabrik dan storan disusun berdasarkan model latihan dan perkhidmatan - bukan IT tujuan umum dengan GPU di sudut. Ia kelihatan seperti gudang. Ia berfungsi seperti stesen janakuasa yang melakukan pengiraan.
Jika anda tidak ingat apa-apa lagi: cip mendapat kemasyhuran; pencawang, penyejuk, dan rangkaian menentukan sama ada cip tersebut adalah idea yang baik. Latihan dan inferens boleh berkongsi bumbung; mereka masih mahukan adab yang berbeza. Kebanyakan organisasi harus menyewa. Beberapa organisasi harus membina. Jiran akan perasan dalam apa jua cara.
Awan sentiasa mempunyai bangunan. Pada masa kini bangunan itu mempunyai pendapat.
Contoh dunia sebenar: Sel latihan dua rak apabila imej tidak dapat keluar
Senario
Tomos ialah peneraju infrastruktur di Kestrel Precision, sebuah pengeluar yang mempunyai 400 orang di West Midlands. Mereka sudah mempunyai dewan kecil di premis: ERP, perkongsian fail, mesin maya, kawasan kejiranan campuran yang dimulakan oleh artikel ini. Penyejukan udara. Ethernet biasa. SAN yang sangat sopan untuk cakera pejabat.
Pasukan visi mesin perlu melatih model pemeriksaan pada gambar pegun kilang. Gambar pegun tidak boleh meninggalkan tapak. Ia menunjukkan proses yang tidak akan diletakkan oleh syarikat pada cakera awan, walaupun cakera persendirian. Penyelesaian Perolehan ialah empat pelayan dwi-pemecut dan slaid bertajuk "pusat data AI kami". Pelayan dimasukkan ke dalam dua rak sedia ada, kerana terdapat ruang, dan ruang terasa seperti kekangan.
Tidak. Dalam masa dua minggu, GPU kedengaran sibuk dan kemudian perlahan-lahan berhenti berfungsi. Pekerjaan merangkak apabila pusat pemeriksaan mengenai SAN. Nod mati pada jam sebelas dan operasi itu... hilang begitu sahaja. Tomos tidak gagal membeli cip. Dia telah membeli timbunan stesen kerja mahal yang berkongsi poskod. Bangunan itu masih merupakan dewan perusahaan.
Mereka tidak memerlukan kampus, pencawang baharu atau sungai. Mereka memerlukan sel kecil yang berfungsi seperti pusat data AI dalam bentuk miniatur: kuasa yang sebenarnya boleh ditampung oleh rak, haba yang keluar tanpa memasak cip, fabrik yang boleh dibincangkan oleh kerja latihan, storan yang boleh mengambil pusat pemeriksaan dan buku larian untuk apabila nod mati. Oleh kerana imej tidak boleh keluar, menyewa sangkar colo empat puluh minit jauhnya bukanlah jawapannya. Mengubah suai dua rak adalah jawapannya.
Apa yang diperlukan oleh sel
-
Bajet kuasa yang diukur pada baris itu, daripada PDU, bukan daripada senarai hajat GPU. Jika kapasiti tambahan tidak dapat memberi makan kepada empat pelayan pada beban latihan, perbualan berhenti di situ dan mereka melihat warna yang lebih padat, bukan keajaiban
-
Penyejukan udara tidak pernah diminta untuk dikendalikan pada ketumpatan ini: penukar haba pintu belakang jika dewan boleh menerimanya, atau gelung cecair kecil jika ia boleh menerimanya. Jika kedua-duanya tidak, pelayan tidak akan masuk
-
Fabrik jalur lebar tinggi khusus antara empat nod, bukan Ethernet pejabat. Jika vendor hanya mempunyai suis 10 Gb dalam katalog, itu bukanlah kluster
-
Storan pantas tempatan untuk pusat pemeriksaan dan serpihan latihan, bukan VM SAN
-
Penjadual, selang waktu pemeriksaan dan laluan mula semula bertulis. Perkakasan adalah yang paling popular. Lapisan ini adalah tugasnya
-
Kotak inferens berpagar untuk barisan kilang, berasingan daripada perbualan latihan, kerana servis mahukan latensi ekor dan pengasingan, bukan kolektif
-
Kebenaran untuk merekod kuasa, jam GPU, peristiwa pendikit dan jam dinding kerja. Jika mereka tidak dapat memeriksanya, mereka akan mengambil gambar GPU dan terlepas suis
Contoh arahan
Tomos menyatakan perkara ini dalam ringkasan kemudahan, dalam bahasa biasa:
Jangan panggil ini kampus AI. Bina sel latihan dua rak di dewan sedia ada untuk empat pelayan dwi-pemecut. Imej kilang kekal di tapak. Kejayaan ialah: empat nod melengkapkan resipi latihan pemeriksaan 12-zaman tanpa pendikit terma, menulis pusat pemeriksaan dalam beberapa minit bukan puluhan minit, dan menyambung semula dari pusat pemeriksaan itu apabila kita membunuh pangkat dengan sengaja. Penyejukan mesti memastikan GPU berada pada jam latihan mereka. Rangkaian mestilah fabrik yang dikongsi oleh empat kotak itu, bukan laluan melalui timbunan pejabat. Penyimpanan mesti memberi makan cip. Jika penukar haba pintu belakang tidak muat, katakan dan hentikan. Jangan sebutkan PUE untuk dua rak di dewan campuran. Nombor itu akan menjadi teater.
Kemudian dia meletakkan ini dalam tugas latihan itu sendiri:
Pusat pemeriksaan setiap 30 minit ke kolam laju tempatan. Jika pangkat mati, mulakan semula dari pusat pemeriksaan terakhir yang lengkap. Jangan tunggu di SAN. Jangan terus berlatih sementara jam telah menurun dari haba. Catatkan dan berhenti supaya kita dapat melihat keadaan.
Jam yang baik kelihatan seperti ini: kesemua lapan GPU pada jam latihan, fail pusat pemeriksaan mendarat, kerja masih berjalan lancar. Jam yang buruk kelihatan seperti ini: kipas pada jam penuh, jam tamat, titik pemeriksaan 2% ditulis selepas sepuluh minit, dan seseorang di pejabat berkata "kluster sudah naik". Naik bukanlah latihan.
Cara mengujinya
Mereka menulis ujian sebelum pengubahsuaian, yang merupakan inti pati tidak mempercayai demo.
-
Resipi 12-zaman yang sama, 120,000 pegun pemeriksaan yang sama, lapan larian
-
Masa adalah mengikut jam dinding sehingga resipi siap, termasuk sebarang permulaan semula, diukur dari penyerahan kerja hingga pusat pemeriksaan terakhir zaman 12
-
Haba yang dilupuskan: Jam GPU kekal pada sasaran latihan untuk larian. Peristiwa pendikit adalah kegagalan walaupun kerja akhirnya selesai
-
Siaran storan: masa tulis pusat pemeriksaan, median dan terburuk, daripada log kerja
-
Fabrik lulus: kerja tidak menunggu secara kolektif semasa pangkat sihat. Jika mereka tidak dapat melihat menunggu itu, instrumentasi tidak selesai
-
Dua daripada lapan larian menyebabkan pangkat terkorban pada langkah tetap, dengan sengaja, untuk menguji laluan permulaan semula
-
Inferens ialah ujian 200 imej yang berasingan dari barisan kilang ke kotak servis berpagar. Kejayaan latihan tidak dikira sebagai kejayaan servis
-
Mereka merekodkan kuasa rak daripada PDU dalam sampel 15 minit jadi tiada siapa yang perlu mencipta megawatt
Penerimaan untuk memanggil sel "sedia AI": 8 daripada 8 resipi selesai; 0 daripada 8 menunjukkan pendikit terma; kedua-dua larian yang dimatikan disambung semula; pusat pemeriksaan kekal dalam beberapa minit. Jika mereka terlepas itu, mereka masih mempunyai bilik pelayan dengan kad grafik yang mewah.
Keputusan
Keputusan ilustrasi, daripada ujian lapan larian yang direka, bukan angka Kestrel yang diterbitkan.
Andaian: empat pelayan dwi-pemecut dalam dua rak; satu model pemeriksaan; 120,000 pegun; lapan larian resipi 12-zaman tetap; jam dinding termasuk mula semula sehingga resipi selesai; pendikit bermaksud penurunan yang direkodkan daripada jam latihan; masa pusat pemeriksaan ialah penulisan, bukan kehendak; kuasa rak ialah sampel PDU, bukan PUE kampus.
Sebelum pengubahsuaian, GPU dalam rak berpendingin udara biasa pada Ethernet pejabat dan VM SAN:
-
5 daripada 8 larian selesai pada percubaan pertama. Median jam dinding antara lima larian tersebut: 14 jam
-
3 daripada 8 terpaksa bermula semula selepas terhenti kira-kira jam 11 (dua selepas nod mati dengan pusat pemeriksaan yang basi, satu selepas pusat pemeriksaan memenuhi SAN). Cuba semula segera, tiada menunggu semalaman dalam masa: 11 jam terbuang ditambah percubaan kedua selama 14 jam, atau 25 jam untuk resipi siap pada ketiga-tiga itu
-
Purata masa untuk resipi siap merentasi kesemua lapan, permulaan semula termasuk: 18 jam. (Lima pada 14, tiga pada 25. Median bagi kesemua lapan masih 14, yang akan menyembunyikan permulaan semula. Itulah sebabnya min ialah garis dasar di sini.)
-
Pendikit haba direkodkan pada 7 daripada 8 larian. Masa median pada jam yang dikurangkan: 3 jam dalam percubaan 14 jam
-
Penulisan di titik semak: median 22 minit
-
Pembunuhan pangkat bukanlah ujian yang boleh mereka lalui. Mereka tidak mempunyai buku larian. Dua kematian akibat kemalangan itu adalah penemuan
-
Beban IT puncak pada dua rak semasa latihan: kira-kira 18 kW. Baris itu mempunyai watt. Ia tidak mempunyai penyejukan atau fabrik
Selepas penukar haba pintu belakang pada dua rak tersebut, fabrik khusus antara empat nod, kolam NVMe kecil untuk pusat pemeriksaan, pusat pemeriksaan 30 minit dan buku larian mula semula:
-
8 daripada 8 siap pada percubaan pertama. Jam dinding median: 9 jam
-
Pendikit terma: 0 daripada 8
-
Catatan di titik semak: median 90 saat. Terburuk dalam set: 3 minit
-
Kedua-dua pembunuhan pangkat yang disengajakan itu disambung semula dari pusat pemeriksaan 30 minit terakhir. Jam dinding tambahan pada dua larian itu: kira-kira 40 minit setiap satu, diagnosis termasuk, jadi kedua-dua larian itu mengambil masa hampir 9 jam 40 minit. Purata merentasi lapan pusingan yang masih aktif hingga 9 jam
-
Beban IT puncak masih kira-kira 18 kW. Cip yang sama. Tingkah laku bangunan yang berbeza
Merentasi sampel ini, purata masa-untuk-resipi-siap menurun daripada 18 jam kepada 9 jam, atau 9 jam setiap satu, 72 jam merentasi lapan larian. Larian-pertama-siap meningkat daripada 5 daripada 8 kepada 8 daripada 8. Pendikit meningkat daripada 7 daripada 8 kepada 0 daripada 8. Nombor terakhir itulah yang menyatakan sama ada mereka membeli pemecut atau pemberat kertas. Mereka tidak akan menganggap perubahan masa sebagai penjimatan 50% dalam pengeluaran. Lapan larian adalah set yang kecil dan mudah.
Angka-angka ini merupakan anggaran contoh berdasarkan ujian yang dinyatakan, sampel kecil, satu model dan satu dewan campuran. Angka-angka ini bukanlah PUE, bukan megawatt kampus dan bukan bukti bahawa Kestrel harus membina tapak latihan di ladang. Semakan kayu balak berada dalam tempoh 9 jam; mereka tidak menyembunyikannya. Angka 18 kW ialah bacaan PDU bulat, bukan invois utiliti. Mereka tidak menukar 72 jam kepada kos, kerana kadar elektrik campuran kilang akan menjadikan kes perniagaan palsu.
Pemeriksaan servis adalah berasingan dan lebih kecil: 200 imej baris ke kotak berpagar, semuanya di lokasi. Itu inferens, bukan latihan. Mencampurkan kedua-duanya akan menjadi kesilapan hibrid-dewan dalam bentuk miniatur.
Apa yang boleh menjadi salah
-
Perolehan terus memanggil empat pelayan sebagai "pusat data AI". Label tersebut menyembunyikan sistem paip, dan pembelian seterusnya adalah lebih banyak GPU untuk lorong sakit yang sama
-
Penukar pintu belakang masuk dan tiada siapa yang mentauliahkan bahagian air. Kipas masih menjerit. Jam masih berbunyi
-
Fabriknya ialah suis tunggal tanpa laluan ganti. Satu pautan gagal dan "kluster" pula ialah empat stesen kerja
-
Pusat pemeriksaan kekal pada SAN kerana kumpulan NVMe adalah "fasa dua". Fasa dua tidak tiba sebelum nod mati seterusnya
-
Mereka memetik PUE untuk dua rak di dewan campuran. Iklim, sempadan, dan seluruh baris ERP menjadikan nisbah itu sebagai kostum
-
Latihan dan servis berkongsi fabrik. Banjir pusat pemeriksaan menyebabkan barisan kilang menunggu. Kependaman ekor adalah produk di sana, bukan ketumpatan
-
Satu nod mati dan seseorang menganggapnya sebagai tiket masa operasi dan bukannya permulaan semula pusat pemeriksaan. Operasi perusahaan dan operasi AI berbual antara satu sama lain sepanjang petang
-
Mereka boleh menyewa sangkar, kecuali imej-imej itu tidak boleh keluar. Terlupa kekangan itu menghantar mereka ke dalam perbualan awan yang perlu mereka berehat
Praktikal bawa pulang
Apakah Pusat Data AI, dalam bentuk ini, bukanlah gudang dan ia bukan invois GPU. Ia adalah sel yang membolehkan pemecut menyelesaikan larian: kuasa yang boleh dipegangnya, haba yang keluar, fabrik, pusat pemeriksaan dan seseorang yang bertanggungjawab apabila pangkat mati. Kestrel tidak memerlukan kampus. Mereka memerlukan dua rak untuk berhenti berpura-pura. Kebanyakan pasukan harus menyewa tingkah laku itu. Beberapa, dengan set data rahsia dan dewan yang boleh menahan haba, harus membina sel dan menolak gelongsor.
Soalan Lazim
Apakah Pusat Data AI?
Tapak pengkomputeran berketumpatan tinggi di mana kuasa, penyejukan, rangkaian dan storan ditumpukan pada latihan selari dan penyampaian model, bukannya barisan pelayan tujuan umum yang kemas. Ia direka bentuk supaya sejumlah besar pemecut boleh melatih dan menyampai model tanpa lebur, terhenti pada rangkaian atau menunggu pada cakera. Dewan perusahaan biasa ialah kawasan kejiranan campuran. Dewan AI ialah monokultur yang unit nilainya ialah pemecut, seperti GPU atau cip gaya TPU. Ia kelihatan seperti gudang dan berkelakuan seperti stesen janakuasa yang melakukan matematik.
Bagaimanakah pusat data AI berbeza daripada pusat data biasa?
Dewan tradisional mengoptimumkan untuk beban kerja campuran dan masa operasi merentasi banyak perkhidmatan kecil. Laman AI mengubah nisbah: ketumpatan meningkat, rangkaian menjadi fabrik yang kerja latihan tidak boleh terbantut tanpanya, dan storan perlu memastikan pusat pemeriksaan bergerak atau pemecut terbiar. Operasi perusahaan berfikir dalam tiket dan menukar tetingkap. Operasi AI berfikir dalam barisan kerja dan rasa mual apabila nod mati lewat dalam jangka masa panjang. Anda masih boleh menghubungi kedua-dua pusat data. Label itu hanya menyembunyikan paip.
Mengapa pusat data AI menggunakan begitu banyak kuasa?
Perkakasan yang menonjol bukanlah CPU yang pintar. Ia adalah dulang pemecut: GPU atau cip AI lain, yang dimasukkan ke dalam pelayan, kemudian rak, kemudian baris yang berkongsi fabrik jalur lebar tinggi. Ketumpatan setiap rak adalah kelainan plot: rak yang lebih sedikit, setiap satu adalah relau kecil. Megawatt beban IT muncul setelah dewan penuh, walaupun mencipta angka tipikal tidak berbaloi. Faktor pengehad selalunya ialah pencawang, bukan senarai hajat GPU.
Bagaimanakah pusat data AI disejukkan?
Rak berketumpatan tinggi membuang haba dengan cara udara tidak pernah diminta untuk mengendalikannya. Anda boleh menolak udara lebih kuat dengan penukar haba pintu belakang, lorong yang lebih panas dan pembendungan yang bijak. Kemudian cecair muncul: penyejukan terus ke cip, gelung penyejuk dan rendaman dalam beberapa reka bentuk. Pemecut yang memecut adalah salah satu yang telah anda bayar dan tidak boleh gunakan sepenuhnya. PUE masih penting kerana setiap watt yang dibelanjakan untuk kipas dan pam adalah watt yang tidak pergi ke GPU. Air juga terdapat dalam cerita: sesetengah tumbuhan menghirup, sesetengah menelan.
Mengapakah rangkaian sama pentingnya dengan GPU?
Latihan adalah perbualan: beribu-ribu pemecut bertukar kecerunan, parameter dan serpihan model dalam penyegerakan yang ketat. Jika fabrik bergegar, seluruh kerja menunggu pada lompatan paling perlahan. Itulah sebabnya AI aula terobsesi dengan rangkaian jalur lebar tinggi, latensi rendah, fabrik seperti InfiniBand atau Ethernet dalam peranan yang sama, dan topologi yang tidak berlipat separuh apabila pautan gagal. Inferens mengambil berat tentang latensi ekor, banyak permintaan yang lebih kecil dan pengasingan. Dalam bangunan ini, paip adalah restoran.
Apakah kegunaan Pusat Data AI: latihan atau inferens?
Latihan adalah satu kempen: kumpulkan kluster, masukkan data, periksa secara teliti dan jalankan selama berjam-jam atau berminggu-minggu. Inferens adalah kedai: model yang sudah dilatih, kini menjawab, dengan kependaman yang penting. Kampus latihan mengejar kuasa, tanah dan kepadatan. Tapak inferens mengejar kependaman dan kehadiran. Dewan hibrid wujud kerana modal tidak terhingga, kadangkala satu dewan dengan dua gelung penyejukan. Pemecut yang sedikit lebih lama berhampiran pelanggan boleh mengalahkan yang glamor di benua jauhnya.
Mengapakah storan penting dalam pusat data AI?
Data latihan perlu tiba cukup pantas supaya GPU tidak bertindak balas. Pusat pemeriksaan perlu mendarat supaya ranap sistem tidak membuang masa seminggu. Pemberat model perlu dimuatkan sebelum replika yang ditayangkan beroperasi. Daya pemprosesan storan, bukan sekadar kapasiti, adalah penghalang yang senyap. Anda boleh membelanjakan banyak wang untuk pemecut dan menghabiskannya dengan tatasusunan yang sopan yang direka bentuk untuk mesin maya.
Apa yang berlaku apabila nod mati pada pertengahan operasi?
Satu pemecut yang mati dalam tugas latihan yang bergandingan rapat boleh melambatkan keseluruhan korus. Latihan mahukan pusat pemeriksaan, bukan optimisme. Inferens menguras nod yang sakit, memastikan replika menjawab dan kekal aktif. Tetingkap perubahan masih bertembung dengan larian latihan yang tidak mempedulikan kalendar anda. Redundansi masih penting untuk kuasa, penyejukan, laluan dan storan, tetapi mod kegagalan kurang kemas berbanding slaid sembilan masa operasi yang lama.
Apakah impak Pusat Data AI terhadap grid, air dan jiran?
Sambungan grid selalunya merupakan proses pemilihan tapak yang sebenar. Tanah adalah mudah berbanding pencawang dan utiliti yang mempunyai pelanggan lain. Air untuk penyejukan, jika anda menggunakannya, menjadi isu jiran sebaik sahaja hujan turun dengan lebat, bersama-sama dengan bunyi bising, pukal visual dan haba di pagar sempadan. Latihan boleh bersembunyi di pasaran kuasa yang lebih murah dan iklim yang lebih sejuk. Inferens suka berada berhampiran pengguna. Tiada satu tapak yang sempurna. Terdapat kompromi dengan siaran akhbar.
Perlukah saya memiliki pusat data AI, atau patutkah saya menyewa?
Kebanyakan orang tidak perlu memiliki salah satu dewan ini. Hiperscaler dibina kerana produknya adalah armada. Makmal dibina apabila masa giliran menjadi kesesakan atau data tidak dapat keluar. Bank, hospital, kerajaan atau pengilang dengan set data rahsia boleh menjadikan sangkar colo di premis atau swasta rasional. Orang lain harus menyewa: lokasi bersama sedia AI, tempahan awan atau kluster terurus. Anda mendapat pemecut tanpa menjadi pengendali loji janakuasa.
Rujukan
-
IEA - www.iea.org
-
LBNL - datacenters.lbl.gov
-
Grid Hijau - www.thegreengrid.org
-
LBNL - datacenters.lbl.gov
-
LBNL - datacenters.lbl.gov
-
Institut Uptime - journal.uptimeinstitute.com
-
NVIDIA - developer.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
Awan Google - docs.cloud.google.com