- Word2Vec mengubah perkataan menjadi vektor dimensi tinggi berdasarkan hipotesis taburan, yang mana makna diperoleh daripada konteks.
- Model ini menggunakan dua seni bina utama: CBOW untuk meramalkan perkataan sasaran daripada konteks dan Skip-Gram untuk meramalkan konteks daripada perkataan sasaran.
- Hubungan semantik ditangkap sebagai ofset linear dalam ruang vektor, membolehkan analogi linguistik melalui operasi matematik.
Pernahkah anda tertanya-tanya bagaimana mesin sebenarnya "memahami" apa yang kita maksudkan apabila kita bercakap? Bukannya kita boleh memberikan kamus kepada komputer dan mengharapkan ia memahami nuansa. Untuk masa yang lama, mesin melihat perkataan hanya sebagai simbol terpencil , yang bermaksud "anjing" sama berbeza daripada "kucing" seperti ia berbeza daripada "ketuhar gelombang mikro". Semua itu berubah dengan ketibaan Word2Vec, pengubah permainan dalam pemprosesan bahasa semula jadi yang membolehkan komputer memetakan perkataan ke dalam ruang matematik di mana makna ditakrifkan oleh jarak.
Pada dasarnya, Word2Vec adalah berdasarkan hipotesis taburan , yang merupakan cara mewah untuk mengatakan bahawa anda boleh memahami sesuatu perkataan berdasarkan syarikat yang dimilikinya. Jika dua perkataan kerap berada di sebelah yang sama, ia mungkin berkongsi makna yang serupa. Dengan menganalisis sejumlah besar teks, Word2Vec mengubah perkataan menjadi vektor berdimensi tinggi , mewujudkan peta semantik di mana hubungan linguistik menjadi geometri mudah.
Sekolah Lama: Pendekatan Berasaskan Kiraan

Sebelum Word2Vec mengambil alih, kami bergantung pada kaedah berasaskan kiraan. Versi paling asas melibatkan matriks kejadian bersama , di mana anda hanya mengira berapa kali perkataan A muncul berhampiran perkataan B. Walaupun mudah, matriks ini menjadi sangat besar dan dipenuhi dengan sifar, menjadikannya mimpi ngeri untuk dikira. Untuk menyelesaikannya, penyelidik menggunakan teknik seperti Maklumat Bersama Titik Positif (PPMI) untuk mengukur perkaitan dengan lebih baik atau Analisis Semantik Laten (LSA) , yang menggunakan Penguraian Nilai Tunggal (SVD) untuk mengecilkan data dan mendedahkan "topik" tersembunyi dalam dokumen.
Bagaimana Word2Vec Sebenarnya Berfungsi

Word2Vec membalikkan skrip dengan menganggap masalah tersebut sebagai tugas ramalan dan bukannya tugas mengira. Daripada hanya mengira perkataan, ia menggunakan rangkaian saraf dua lapisan yang cetek untuk mempelajari penyematan. Model ini melancarkan tetingkap merentasi korpus teks yang besar, memfokuskan pada perkataan pusat dan konteks sekitarnya. Dengan melaraskan vektor secara berulang untuk memaksimumkan kebarangkalian meramalkan jiran yang betul, model secara semula jadi menolak perkataan yang serupa secara semantik lebih dekat bersama dalam ruang vektor.
Dua Cara untuk Melatih: CBOW vs. Skip-Gram

- Beg Perkataan Berterusan (CBOW): Anggap ini sebagai latihan "isi tempat kosong". Model ini melihat perkataan konteks di sekeliling dan cuba untuk ramalkan perkataan tengah yang hilangIa biasanya lebih pantas untuk dilatih dan berfungsi dengan baik untuk perkataan yang kerap disebut.
- Skip-Gram: Ini adalah pendekatan songsang. Model ini mengambil satu perkataan tengah dan cuba untuk meramalkan konteks sekelilingWalaupun ia mengambil lebih banyak masa, Skip-Gram jauh lebih baik dalam mengendalikannya perkataan yang jarang berlaku dan menangkap hubungan semantik yang jarang berlaku.
Menjadikan Latihan Berkesan: Pensampelan Negatif

Mengira kebarangkalian untuk setiap perkataan dalam perbendaharaan kata yang besar setiap kali anda menggerakkan tetingkap akan menjadi sangat perlahan . Untuk mengelakkan ini, Word2Vec menggunakan Pensampelan Negatif . Daripada mengemas kini setiap perkataan dalam kamus, model hanya mengemas kini perkataan sasaran dan segelintir kecil contoh "negatif" yang dipilih secara rawak . Ini mengurangkan beban pengiraan secara drastik tanpa mengorbankan kualiti penyematan yang dipelajari, selalunya mengambil sampel perkataan berdasarkan taburan frekuensinya untuk memastikan model tidak menjadi malas.
Keajaiban Ruang Semantik
Sebaik sahaja latihan selesai, hasilnya adalah ruang semantik di mana anda sebenarnya boleh melakukan matematik pada perkataan. Salah satu penemuan paling menarik ialah hubungan ini selalunya linear . Contohnya, jika anda mengambil vektor untuk "Raja," tolak "Lelaki," dan tambah "Wanita," titik yang terhasil dalam ruang adalah sangat hampir dengan vektor untuk "Ratu." Ini menunjukkan bahawa model tersebut telah menangkap konsep abstrak jantina dan kerabat diraja melalui aritmetik vektor mudah.
Melangkaui Perkataan Asas: Sambungan dan Varian
Kejayaan Word2Vec mencetuskan pelbagai rangkaian sambungan. Doc2Vec mengembangkan idea untuk mewakili keseluruhan perenggan atau dokumen sebagai vektor tunggal, membolehkan pengelasan dokumen lanjutan. Kemudian muncul Top2Vec , yang menggabungkan penyematan dokumen dengan algoritma pengelompokan seperti HDBSCAN untuk menemui topik secara automatik tanpa memerlukan data berlabel. Malah sains biologi turut serta dengan BioVec , mengaplikasikan prinsip-prinsip ini pada jujukan DNA dan protein untuk memahami corak biokimia.
Menilai Keputusan
Bagaimanakah kita tahu sama ada model itu sebenarnya "pintar"? Terdapat dua cara utama. Penilaian intrinsik melihat sifat dalaman, menggunakan penanda aras untuk melihat sama ada skor persamaan model sejajar dengan pertimbangan manusia atau sama ada ia boleh menyelesaikan ujian analogi . Penilaian ekstrinsik lebih praktikal; ia melibatkan memasukkan penyematan ke dalam tugas dunia sebenar, seperti analisis sentimen atau pengelasan teks, untuk melihat sama ada prestasi keseluruhan bertambah baik. Walaupun model yang lebih baharu seperti BERT atau ELMo menyediakan penyematan kontekstual (bermaksud vektor perkataan berubah berdasarkan ayat), Word2Vec kekal sebagai asas asas untuk perwakilan perkataan statik.
Dengan mengubah kekacauan bahasa manusia menjadi landskap geometri berstruktur , teknik ini membolehkan mesin menavigasi makna melalui persamaan kosinus dan ofset vektor. Daripada kecekapan persampelan negatif kepada fleksibiliti Skip-Gram dan CBOW, keupayaan untuk memetakan konteks linguistik ke dalam koordinat matematik telah mengubah secara asas cara kita membina segala-galanya daripada enjin carian hinggalah alat terjemahan.
