- Google sedang membangunkan "TorchTPU" untuk menjadikan cip AInya serasi sepenuhnya dengan PyTorch dan memudahkan penghijrahan daripada GPU Nvidia.
- Langkah ini bertujuan untuk menjadikan TPU sebagai alternatif arus perdana di awan dan di premis, sekali gus mengurangkan pergantungan pada ekosistem CUDA Nvidia.
- Google sedang bekerjasama rapat dengan Meta, pengurus PyTorch dan mempertimbangkan bahagian penyumberan terbuka bagi susunan tersebut untuk mempercepatkan penggunaannya.
- Sokongan PyTorch yang lebih kukuh dapat mengurangkan kos dan halangan teknikal bagi perusahaan yang ingin mempelbagaikan infrastruktur AI mereka.
Google secara senyap-senyap sedang membentuk semula strateginya dalam perlumbaan untuk pengkomputeran kecerdasan buatan . Selepas bertahun-tahun menumpukan pada jenama dalaman mereka sendiri, syarikat itu kini memberi tumpuan sebenar untuk memastikan cip AI mereka berfungsi dengan lancar dengan PyTorch, kit alat sumber terbuka yang telah menjadi pilihan lalai bagi kebanyakan pembangun AI di seluruh dunia.
Teras perubahan ini ialah projek yang dikenali secara dalaman sebagai "TorchTPU" , satu usaha yang direka untuk merapatkan jurang antara cara perkakasan Google dibina dan cara pelanggan sebenarnya membina sistem AI mereka. Dengan membawa sokongan PyTorch ke status kelas pertama pada Unit Pemprosesan Tensor (TPU), Google ingin mengurangkan kelebihan besar yang telah dibina oleh Nvidia melalui ekosistem perisian CUDAnya.
Google menjadikan TPU sebagai pesaing serius untuk GPU Nvidia
TPU Google telah lama digelar sebagai cip berprestasi tinggi yang disesuaikan untuk beban kerja AI , tetapi ia tidak menandingi kewujudan GPU Nvidia di mana-mana. Satu sebab utama ialah Nvidia menghabiskan masa bertahun-tahun memastikan PyTorch berfungsi dengan sangat baik pada perkakasannya, sementara Google memberi tumpuan terutamanya pada alatan dan aliran kerja dalamannya sendiri.
Dalam Alphabet, TPU telah menjadi enjin pertumbuhan kritikal untuk Google Cloud . Menjual akses kepada cip ini melalui platform awannya kini merupakan bahagian penting dalam cara Google berhasrat untuk membuktikan kepada pelabur bahawa pelaburan AInya boleh diterjemahkan kepada pendapatan ketara, bukan sekadar penyelidikan prestij atau produk eksperimen.
Walau bagaimanapun, perkakasan sahaja tidak dapat memenangi hati pembangun. Perusahaan yang melihat TPU telah berulang kali memberitahu Google bahawa keserasian perisian telah menjadi titik pertikaian : pasukan yang telah banyak menyeragamkan PyTorch tidak mahu mereka bentuk semula kod mereka atau melatih semula kakitangan hanya untuk mencuba cip baharu.
Di sinilah TorchTPU memainkan peranan. Inisiatif ini bertujuan untuk menjadikan TPU terasa, dari sudut pandangan pembangun, semudah digunakan dengan PyTorch seperti GPU Nvidia hari ini . Matlamatnya adalah agar model dan saluran paip PyTorch sedia ada dapat dipindahkan dengan perubahan yang minimum, jadi kos dan risiko bereksperimen dengan TPU menurun dengan mendadak.
Seorang jurucakap Google Cloud telah mengelak daripada mengulas lanjut tentang spesifikasi teknikal, tetapi mengesahkan bahawa matlamat utamanya adalah untuk memberi pelanggan fleksibiliti yang jauh lebih besar dalam cara mereka menjalankan beban kerja AI , tanpa mengira perkakasan yang mereka pilih.
Apa yang sebenarnya diubah oleh TorchTPU untuk pembangun PyTorch
PyTorch, yang pada asalnya dicipta dan dipromosikan oleh Meta, telah menjadi rangka kerja standard de facto untuk membina sistem AI moden . Kebanyakan jurutera di Silicon Valley dan seterusnya bukanlah kernel pengekodan tangan untuk cip Nvidia, AMD atau Google; sebaliknya, mereka bergantung pada PyTorch dan rangka kerja serupa yang menyediakan lapisan komponen prabina dan utiliti latihan.
Sejak pelancarannya pada tahun 2016, pertumbuhan PyTorch berkait rapat dengan CUDA dan perpustakaan di sekelilingnya , susunan perisian yang dianggap oleh ramai penganalisis Wall Street sebagai aset strategik Nvidia yang paling penting. Jurutera Nvidia telah banyak melabur untuk memastikan PyTorch berjalan dengan kecekapan maksimum pada GPU mereka, menjadikan pasangan ini pilihan lalai untuk melatih dan menggunakan model AI berskala besar.
Sebaliknya, Google menghabiskan masa bertahun-tahun menyokong Jax , satu lagi rangka kerja perisian yang digemari terutamanya dalam pasukan penyelidikan dan produknya sendiri. TPU bergantung pada lapisan pengkompil yang dipanggil XLA untuk menjalankan kod berasaskan Jax dengan cekap, dan kebanyakan susunan perisian AI dalaman Google dan pengoptimuman prestasi dibina berdasarkan gabungan tersebut.
Hasilnya ialah terdapat ketidakpadanan yang semakin meningkat antara cara Google sendiri menggunakan cipnya dan cara kebanyakan pelanggan luaran lebih suka bekerja. Banyak perusahaan telah menyeragamkan hampir keseluruhannya pada PyTorch, yang bermaksud bahawa peralihan kepada TPU biasanya menunjukkan perubahan yang mengganggu dalam kemahiran perkakasan, kod dan pembangun.
Dengan TorchTPU, Google cuba menghilangkan geseran tersebut. Projek ini bertujuan untuk memberikan sokongan PyTorch sepenuhnya pada TPU , supaya syarikat boleh terus bergantung pada pustaka, gelung latihan dan corak penggunaan yang biasa sambil hanya mengubah sasaran perkakasan asas. Ini boleh mengurangkan usaha kejuruteraan dan lengkung pembelajaran dengan ketara untuk pasukan yang ingin menilai prestasi TPU atau kelebihan kos.
Lebih banyak sumber, sumber terbuka dan komitmen yang lebih mendalam
Menurut orang yang biasa dengan inisiatif ini, TorchTPU bukan sekadar eksperimen sampingan. Tidak seperti beberapa percubaan terdahulu untuk menjalankan PyTorch pada TPU, Google kini telah memberikan lebih banyak perhatian organisasi, bajet dan kepentingan strategik kepada usaha ini, menganggapnya sebagai tonggak utama pelan tindakan infrastruktur AI dan bukannya projek keserasian khusus.
Salah satu elemen paling ketara yang sedang dipertimbangkan ialah bahagian penyumberan terbuka bagi susunan perisian di sebalik TorchTPU. Dengan melancarkan komponen utama kepada komuniti, Google berharap dapat mempercepatkan penggunaan, menarik penyumbang luaran dan membina kepercayaan dalam kalangan pelanggan besar yang mahukan ketelusan dan kestabilan jangka panjang dalam platform AI mereka.
Sikap yang lebih terbuka ini juga bertujuan untuk meyakinkan syarikat-syarikat yang telah melihat sokongan TPU sebagai terlalu terikat dengan cara dalaman Google dalam melakukan sesuatu. Memberi peluang kepada pembangun luaran untuk memeriksa, melanjutkan dan menyahpepijat komponen TorchTPU boleh menjadikan TPU terasa kurang seperti pulau proprietari dan lebih seperti warga kelas pertama dalam ekosistem PyTorch yang lebih luas.
Bagi perusahaan, ini penting secara praktikal. Jika TorchTPU berjaya, ia boleh mengurangkan kos migrasi daripada GPU Nvidia kepada TPU Google dengan ketara , menjadikannya lebih sesuai untuk mempelbagaikan infrastruktur pengkomputeran tanpa memulakan penulisan semula perisian selama bertahun-tahun.
Pelanggan telah berulang kali memberitahu Google bahawa keperluan bersejarah untuk beralih kepada Jax merupakan penghalang utama. PyTorch sudah mendominasi dalam kalangan pembangun AI dan dalam pasaran yang bergerak pantas, hanya sedikit organisasi yang sanggup menghentikan sementara pelan tindakan produk sementara pasukan mereka mengubah suai rangka kerja baharu hanya untuk mengakses perkakasan alternatif.
Daripada perkakasan dalaman kepada tawaran perusahaan yang luas
Untuk masa yang lama, Alphabet mengekalkan sebahagian besar kapasiti TPUnya untuk kegunaan dalaman di Google , memperkasakan carian, terjemahan, sistem cadangan dan penyelidikan AI awal. Pendirian itu mula berubah pada tahun 2022, apabila bahagian pengkomputeran awan diberi kuasa yang lebih besar ke atas cara TPU dihasilkan dan dijual.
Sejak itu, ketersediaan TPU melalui Google Cloud telah meningkat dengan ketara . Memandangkan minat perusahaan terhadap AI telah dipercepatkan, Google telah meletakkan cipnya sebagai cara untuk pelanggan memanfaatkan pengkomputeran mewah tanpa perlu mengurus kluster GPU mereka sendiri yang berkait rapat.
Baru-baru ini, Google telah melangkah lebih jauh dengan menjual TPU secara langsung untuk penggunaan di pusat data pelanggan sendiri , bukan hanya melalui awan awamnya. Peralihan itu membolehkan organisasi yang lebih besar dengan keperluan kawal selia atau latensi yang ketat untuk mengintegrasikan TPU ke dalam infrastruktur di premis mereka sambil masih mendapat manfaat daripada pelan tindakan perkakasan Google.
Pengembangan ini juga membentuk semula keutamaan dalaman Google. Syarikat itu memerlukan kapasiti TPU untuk menjalankan produk AInya sendiri — daripada chatbot Gemini kepada ciri carian berkuasa AI — dan untuk melayani pelanggan Google Cloud luaran, termasuk firma AI berprofil tinggi seperti Anthropic yang bergantung pada kapasiti TPU yang disewa.
Untuk menyelaras semua ini, Google telah meningkatkan kepimpinan infrastruktur AI: eksekutif veteran Amin Vahdat telah dilantik sebagai ketua infrastruktur AI dan kini melapor terus kepada Ketua Pegawai Eksekutif Sundar Pichai . Barisan pelaporan itu menggariskan betapa pentingnya susunan perkakasan dan perisian kepada cita-cita AI Google yang lebih luas.
Bekerjasama dengan Meta untuk mengukuhkan PyTorch pada TPU
Google tidak mengejar TorchTPU secara bersendirian. Menurut mereka yang mengetahui rundingan tersebut, syarikat itu sedang bekerjasama rapat dengan Meta, pencipta dan pengurus PyTorch , untuk mempercepatkan sokongan untuk TPU dan menyelaraskan hala tuju teknikal yang memberi manfaat kepada kedua-dua rakan kongsi.
Perbincangan antara syarikat-syarikat tersebut termasuk pengaturan yang akan memberi Meta akses kepada lebih banyak kapasiti TPU . Cadangan terdahulu dilaporkan membingkaikan ini sebagai perkhidmatan terurus: Google akan menggunakan cipnya dalam persekitaran di mana Meta boleh menjalankan perisian dan modelnya sendiri, dengan Google mengendalikan sebahagian besar overhed operasi.
Bagi Meta, memastikan PyTorch berjalan dengan cekap merentasi pelbagai perkakasan adalah penting secara strategik. Syarikat itu mempunyai insentif yang jelas untuk mengurangkan kos inferens dan mempelbagaikan daripada pergantungan eksklusif pada GPU Nvidia , untuk mengurangkan perbelanjaannya sendiri dan untuk mengukuhkan kedudukan tawar-menawarnya semasa merundingkan pembelian cip pada masa hadapan.
Dengan bekerjasama dengan Google, Meta dapat membantu memastikan PyTorch kekal agnostik perkakasan dan dioptimumkan secara meluas , dan bukannya dilihat terikat rapat dengan ekosistem vendor tunggal. Ini seterusnya mengukuhkan status PyTorch sebagai standard komuniti dan memastikan rangka kerja tersebut menarik minat penyelidik dan perusahaan.
Meta setakat ini enggan mengulas secara terbuka mengenai pengaturan khusus ini, tetapi penjajaran kepentingan adalah jelas : gergasi media sosial dan AI mahukan pilihan di luar Nvidia, manakala Google mahu PyTorch terasa asli pada TPUnya supaya lebih ramai pelanggan sanggup mencubanya.
Mengurangkan kelebihan CUDA Nvidia
Penguasaan Nvidia dalam AI bukan sekadar penghantaran GPU yang berkuasa. Selama bertahun-tahun, syarikat itu telah membina susunan perisian yang luas—ditunjangkan oleh—yang disepadukan secara mendalam ke dalam rangka kerja seperti PyTorch. Gabungan perkakasan dan perisian ini telah menjadi platform latihan dan inferens lalai untuk model AI canggih.
Disebabkan integrasi yang ketat itu, banyak organisasi melihat peralihan daripada Nvidia sebagai berisiko dan mahal . Pangkalan kod, aliran kerja dan kepakaran kakitangan semuanya ditala untuk CUDA, menjadikan cip alternatif kelihatan seperti sumber geseran yang berpotensi walaupun ia menjanjikan harga atau prestasi yang lebih baik di atas kertas.
Usaha TorchTPU Google merupakan percubaan langsung untuk menghakis kelebihan tersebut. Jika PyTorch boleh berjalan pada TPU dengan tahap kemudahan dan penalaan prestasi yang serupa seperti pada GPU Nvidia, perusahaan akan mendapat alternatif yang boleh dipercayai untuk beban kerja AI yang besar . Dalam pasaran di mana permintaan untuk pengkomputeran AI meletup dan kekangan bekalan adalah perkara biasa, mempunyai pilihan serius lain mungkin sangat menarik.
Pada masa yang sama, keputusan Google untuk mempertimbangkan bahagian penting penyumberan terbuka bagi susunan TorchTPU menandakan pendekatan yang berbeza daripada gaya Nvidia yang lebih bersepadu secara vertikal. Dengan berkongsi lebih banyak perisian asas, Google berhasrat untuk membina keyakinan dalam kalangan pembangun yang menghargai ketelusan dan kebolehgunaan.
Tiada satu pun daripada ini yang menjamin bahawa TPU akan menggantikan GPU, tetapi ia mengubah kalkulus. Daripada memilih antara ekosistem matang Nvidia dan alternatif yang memerlukan migrasi set alat penuh, pelanggan boleh mempertimbangkan prestasi, kos dan ketersediaan sambil kekal dalam persekitaran PyTorch yang biasa.
Merentasi penggunaan awan dan di premis, perubahan itu dapat memudahkan organisasi untuk mencampur dan memadankan penyedia perkakasan dari semasa ke semasa, daripada mengunci peta jalan AI mereka kepada vendor tunggal secara lalai.
Ketika Google memperdalam komitmennya terhadap PyTorch melalui TorchTPU, meningkatkan akses perusahaan kepada TPU dan mengetatkan kerjasama dengan Meta, landskap persaingan di sekitar infrastruktur AI menjadi lebih cair. Peneraju Nvidia, yang dibina berdasarkan perkakasan dan penyepaduan CUDA selama bertahun-tahun, masih besar, tetapi pelanggan kini melihat laluan yang lebih realistik untuk mempelbagaikan tempat beban kerja AI mereka dijalankan dan berapa banyak yang mereka bayar untuk pengkomputeran asas.
