- SQL merupakan fokus utama dalam temu bual penganalisis data, dengan penekanan yang kuat pada gabungan, pengagregatan, fungsi tetingkap dan pertanyaan yang boleh dibaca.
- Python biasanya dinilai melalui kemahiran panda praktikal, statistik asas dan visualisasi mudah dan bukannya ML lanjutan.
- Menggabungkan SQL untuk pengekstrakan yang cekap dengan Python untuk analisis fleksibel menghasilkan aliran kerja analitik hujung ke hujung yang berkuasa.
- Amalan terbaik dunia sebenar berkaitan sambungan, keselamatan, prestasi dan pelaporan automatik membezakan calon yang kukuh.

Melangkah ke temu duga teknikal SQL dan Python sebagai penganalisis data yang bercita-cita tinggi boleh terasa agak menakutkan, terutamanya apabila anda membaca kisah-kisah seram tentang ujian pengekodan mengejut atau orang yang gagal kerana mereka diberi komputer riba yang tidak dikenali. Jika anda baru memulakan kerjaya dalam analitik, adalah perkara biasa untuk bimbang tentang tidak mengingati setiap arahan untuk regresi logistik atau sintaks tepat fungsi tetingkap.
Berita baiknya ialah kebanyakan syarikat tidak mencari penyusun manusia, mereka mencari orang yang berfikir dengan jelas dengan data, boleh menulis SQL yang agak bersih, selesa dengan Python dan Excel asas, dan tahu cara menyampaikan hasil. Dengan persediaan yang fokus, anda boleh mengubah kebimbangan itu menjadi keyakinan dan memulakan temu duga anda dengan idea yang jelas tentang apa yang diharapkan dan cara untuk bertindak balas.
Mengapa SQL dan Python sangat penting dalam temu bual penganalisis data
Untuk peranan analitik perniagaan, SQL biasanya merupakan alat utama di bawah mikroskop semasa temu duga teknikal, kerana bahasa inilah yang membolehkan anda menarik, menggabungkan, menapis dan mengagregatkan data terus daripada gudang data syarikat. Kebanyakan kajian kes praktikal yang anda dapat dalam temu duga akan bermula dengan “ini pangkalan data, tulis pertanyaan untuk menjawab soalan-soalan ini”.
Python, sebaliknya, sering dianggap sebagai kelebihan yang kuat dan bukannya satu kemestian mutlak untuk peranan penganalisis junior, tetapi kepentingannya terus berkembang. Perekrut menyukai Python kerana bahasa yang sama boleh digunakan untuk automasi, pembersihan data, papan pemuka, eksperimen, prototaip pembelajaran mesin dan banyak lagi. Banyak syarikat menyatakan "Python adalah sesuatu yang bagus untuk dimiliki" dalam huraian kerja, kemudian secara senyap-senyap memeriksa siapa yang sebenarnya tahu cara menggunakan panda.
Gabungan SQL untuk pengekstrakan dan Python untuk analisis ini bukan sekadar pilihan teknologi, ia adalah pilihan strategik, kerana bersama-sama mereka mewujudkan aliran kerja yang kukuh dan boleh diskala: SQL mengendalikan set data hubungan yang besar dengan cekap, manakala Python memberi anda fleksibiliti untuk statistik, visualisasi, pelaporan dan juga pemodelan ramalan.
Jika anda menunjukkan bahawa anda boleh bergerak dengan lancar antara dua dunia ini, anda serta-merta akan menonjol, memandangkan anda membuktikan bahawa anda boleh beralih daripada jadual mentah di gudang kepada pandangan yang boleh diambil tindakan dalam buku nota, dek slaid atau laporan automatik.
Cara temu bual penganalisis data teknikal biasanya berfungsi
Temu bual teknikal penganalisis data cenderung untuk menggabungkan soalan konseptual dengan latihan amali, bukannya sekadar kuiz Soal Jawab. Anda biasanya diminta untuk menerangkan konsep (jenis JOIN, apakah fungsi tetingkap, cara anda mengendalikan nilai yang hilang) dan kemudian menyelesaikan masalah pendek dengan SQL atau Python serta-merta atau dalam tugasan bawa pulang.
Ramai calon hanya menjangkakan soalan aras tinggi dan terkejut apabila mereka perlu menulis kod sebenar, kadangkala dalam persekitaran yang tidak dikenali. Contohnya, sesetengah orang berasa gementar kerana mereka mesti mengekod pada macOS dan bukannya Windows, walaupun sintaks SQL dan Python adalah sama. Apa yang sebenarnya berubah ialah editor, pintasan papan kekunci atau arahan terminal, bukan bahasa itu sendiri.
Syarikat menggunakan tugasan ini untuk mengesahkan bahawa kemahiran pada CV anda adalah sebenar dan anda boleh menyelesaikan masalah yang bermasalah, bukan sekadar mengulang definisi buku teks. Mereka mengambil berat tentang cara anda menstrukturkan pertanyaan anda, cara anda menyahpepijat apabila sesuatu gagal, sama ada anda menyemak kualiti data dan sama ada anda mengemukakan soalan penjelasan sebelum terus mendalami.
Dalam sesetengah proses, langkah yang paling mencabar ialah ujian bawa pulang yang menggabungkan SQL dan Excel (atau hamparan), di mana anda mungkin perlu mencipta jadual sampel untuk menguji pertanyaan, mengendalikan banyak medan tarikh, menggunakan fungsi tetingkap, cantuman, klausa WHERE, CTE dan kemudian memformat semuanya dengan jelas dalam dokumen. Latihan seperti ini selalunya mengambil masa lebih lama daripada yang dijangkakan, terutamanya jika anda tidak sepenuhnya biasa dengan domain industri.
Perubahan minda utama adalah untuk menganggap temu duga sebagai projek perundingan kecil dan bukannya peperiksaan, di mana anda cuba memahami persoalan perniagaan, meneroka data dan menghasilkan jawapan yang jelas dan bernas dan bukannya hanya "lulus ujian".
Soalan SQL yang paling mungkin anda hadapi (dan cara menyelesaikannya)
Merentasi syarikat dan sektor, soalan SQL untuk peranan penganalisis data mengikuti corak yang agak boleh diramal, beralih daripada penapisan dan cantuman asas kepada agregat, subkueri dan fungsi tetingkap. Jika anda kukuh dalam blok binaan ini, anda boleh mengendalikan sebahagian besar tugasan temu duga.
Pada peringkat permulaan hingga pertengahan, penemuduga jarang sekali cuba memperdaya anda dengan ciri-ciri dialek yang kabur, tetapi mereka akan menjangkakan anda menggabungkan pelbagai konsep: contohnya, menggabungkan dua jadual, menapis mengikut julat tarikh, mengelompokkan mengikut kategori dan menambah fungsi tetingkap untuk menilai kedudukan pelanggan.
Konsep SQL teras yang mesti anda miliki dengan kukuh
Salah satu soalan paling klasik ialah perbezaan antara DI MANA dan MEMPUNYAI, kerana ia mendedahkan sama ada anda benar-benar memahami bila penapis digunakan dalam kitaran hayat pertanyaan. WHERE menapis baris sebelum pengelompokan; HAVING menapis kumpulan selepas pengagregatan.
Satu lagi topik malar hijau ialah jenis JOIN dan bila perlu menggunakan setiap satunya, biasanya dirangka berdasarkan senario perniagaan yang mudah. Anda sepatutnya dapat menerangkan cantuman dalaman, kiri, kanan dan luaran penuh, dan memilih dengan sewajarnya bergantung pada jadual yang merupakan sumber "utama" anda yang mesti dikekalkan dalam hasilnya.
Subpertanyaan juga merupakan perkara biasa, terutamanya apabila penemuduga ingin melihat sama ada anda boleh membahagikan masalah kepada beberapa langkah, seperti mengira purata setiap pelanggan dan kemudian memilih hanya mereka yang melebihi ambang tertentu. Anda mungkin diminta untuk menulis subpertanyaan dalam klausa SELECT, FROM atau WHERE/HAVING dan menjelaskan mengapa anda memilih struktur tersebut.
Fungsi tetingkap adalah kegemaran dalam temu bual penganalisis moden kerana ia membuka kedudukan dan perbandingan merentasi baris, tanpa melipat set data. Anda sering akan diminta untuk menghasilkan jumlah berjalan, pangkat padat atau agregat yang dibahagikan dan untuk menjelaskan bagaimana ia berbeza daripada GROUP BY biasa.
Contoh topik SQL dan cara membincangkannya
Bayangkan anda diminta untuk menerangkan WHEN anda akan menggunakan HAVING dan bukannya WHERE, Anda mungkin boleh mengatakan sesuatu seperti: “WHERE digunakan untuk menapis baris mentah, manakala HAVING digunakan selepas GROUP BY untuk menapis kumpulan yang telah diagregatkan. Contohnya, jika saya mahukan jabatan dengan lebih daripada 5 pekerja, saya akan mengumpulkan mengikut jabatan dan kemudian menggunakan HAVING pada COUNT(*) > 5, kerana COUNT ialah agregat yang tidak tersedia dalam WHERE.”
Untuk soalan JOIN, penemuduga sering meminta definisi dan penggunaan praktikal, seperti: gabungan dalaman apabila anda hanya mementingkan padanan, gabungan kiri apabila anda ingin menyimpan semua entri daripada jadual utama walaupun tiada rekod yang sepadan dalam jadual carian, dan sebagainya. Anda boleh mengukuhkan jawapan anda dengan menyebut bahawa gabungan kiri adalah sangat biasa dalam analitik apabila anda mempunyai jadual "fakta" dan data "dimensi" pilihan.
Apabila subpertanyaan muncul, ia membantu menghubungkannya dengan tugasan analisis sebenar, seperti mendapatkan semua pelanggan yang jumlah perbelanjaannya melebihi purata perbelanjaan pelanggan global. Anda boleh menerangkan cara membuat subkueri yang mengira jumlah setiap pelanggan, kemudian mengira purata set tersebut dan akhirnya menapis pertanyaan luaran.
Untuk fungsi tetingkap, fokus pada keupayaannya untuk melihat merentasi baris yang berkaitan tanpa melipatnya, contohnya untuk menilai wakil jualan mengikut hasil bulanan atau untuk mengira jumlah bergulir selama beberapa hari. Adalah berguna untuk menekankan bagaimana ini berbeza daripada GROUP BY, yang sentiasa mengurangkan bilangan baris dalam set hasil.
Kes penggunaan yang disukai oleh penemuduga: fungsi tetingkap, tarikh dan CTE
Dalam temu duga sebenar, fungsi tingkap, pengendalian tarikh dan CTE kerap muncul bersama, terutamanya apabila anda diminta untuk mengira metrik dari semasa ke semasa atau mengenal pasti prestasi terbaik setiap segmen. Contohnya, anda mungkin menggabungkan jadual jualan ke jadual pelanggan, kemudian menggunakan fungsi tetingkap yang dibahagikan mengikut pelanggan untuk mengira nilai seumur hidup atau tarikh pembelian terakhir.
Tarikh temu janji ada di mana-mana dalam analitik, jadi perekrut memberi perhatian kepada betapa selesanya anda dengannya, termasuk mengekstrak hari, minggu, bulan, pengendalian zon waktu (sekurang-kurangnya secara konseptual) dan menapis mengikut julat masa. Calon yang mengabaikan sepenuhnya nuansa tarikh boleh memecahkan laporan tanpa menyedarinya.
Ungkapan Jadual Biasa (CTE) merupakan satu lagi konsep yang kerap timbul, selalunya melalui soalan seperti “Bagaimana anda akan menyusun pertanyaan yang sangat kompleks?”. Jawapan yang kukuh adalah dengan mengatakan bahawa anda menggunakan CTE untuk memecahkan logik kepada blok yang boleh dibaca dan boleh digunakan semula, menjadikan penyelenggaraan dan penyahpepijatan lebih mudah berbanding jika semuanya tersekat dalam subpertanyaan bersarang.
Apabila anda berlatih untuk temu duga anda, luangkan masa sebenar menulis SQL yang merangkaikan elemen-elemen ini: gabungan, penapis, pengelompokan, fungsi tetingkap, CTE dan logik tarikh, kerana itulah rupa pertanyaan perniagaan yang realistik, bukan satu SELECT dengan satu syarat WHERE.
Apa yang sebenarnya diharapkan oleh syarikat peringkat Python dalam skrin teknikal
Untuk peranan penganalisis data tulen (berbanding saintis data atau kejuruteraan backend), syarikat biasanya menumpukan pada Python praktikal untuk data, bukan pada pembinaan algoritma yang canggih dari awal. Mereka mahu melihat bahawa anda boleh membaca CSV, memeriksa data, membersihkannya, membentuknya semula dengan panda dan mungkin menghasilkan beberapa visualisasi asas.
Anda jarang dijangka menghafal tandatangan import tepat bagi setiap model pembelajaran mesin atau untuk mengingati sintaks penuh panggilan regresi logistik dari atas kepala anda. Kebanyakan penemuduga faham bahawa dalam kehidupan sebenar anda akan menyemak dokumentasi atau coretan, selagi anda tahu apa yang anda cuba lakukan secara konseptual.
Topik Python biasa untuk skrin penganalisis data ialah pengendalian nol, penapisan, operasi kumpulan mengikut, penggabungan/penyertaan dan pengiraan mudah, kadangkala digabungkan dalam bekas kecil ala buku nota di mana anda menerangkan penaakulan anda langkah demi langkah.
Visualisasi sering muncul sebagai keperluan ringan: berupaya menghasilkan carta bar asas atau plot siri masa, bukan untuk mereka bentuk papan pemuka piksel yang sempurna. Matlamat utama adalah untuk memastikan anda boleh menyampaikan dapatan anda secara visual apabila diperlukan.
Operasi panda penting yang perlu anda fasih
Mengendalikan nilai yang hilang merupakan kemahiran panda teras yang hampir selalu muncul, sama ada sebagai soalan langsung (“Bagaimana anda akan menangani sifar?”) atau terbenam dalam tugasan praktikal. Anda sepatutnya dapat menunjukkan cara memeriksa kekurangan, menggugurkan baris atau lajur jika sesuai dan mengimput nilai menggunakan strategi mudah seperti min atau median.
Penapisan baris merupakan satu lagi operasi yang mesti diketahui kerana ia mencerminkan WHERE dalam SQL, dan ia adalah asas untuk hampir semua analisis. Penemuduga mungkin meminta anda memilih baris berdasarkan ambang, berbilang syarat atau keahlian dalam senarai nilai.
Groupby dalam panda adalah padanan kasar GROUP BY dalam SQL dan sering digunakan untuk menguji keupayaan anda untuk mengagregat, contohnya untuk mengira jumlah jualan setiap kategori, purata pendapatan setiap pelanggan atau kiraan acara setiap hari. Adalah penting bukan sahaja untuk mengetahui sintaks, tetapi juga untuk menjelaskan mengapa anda mengumpulkan mengikut lajur tertentu.
Penggabungan kerangka data adalah selari langsung dengan SQL JOIN dan penting ketika berurusan dengan berbilang jadual, seperti menggabungkan set data transaksi dengan jadual pelanggan. Anda harus selesa memilih kekunci gabung, menentukan jenis gabung dan menyemak kekunci pendua atau pendaraban baris yang tidak dijangka.
Python melangkaui panda: sambungan, statistik dan visualisasi
Dalam pasukan yang lebih matang dari segi teknikal, anda juga mungkin dijangka tahu cara menyambungkan Python ke pangkalan data SQL, supaya anda boleh menjalankan pertanyaan terus daripada skrip anda dan memuatkan hasil ke dalam panda. Di sinilah pustaka seperti psycopg2, PyMySQL, pyodbc, sqlite3 atau alatan peringkat lebih tinggi seperti SQLAlchemy memainkan peranan.
SQLAlchemy, khususnya, popular kerana ia menyediakan cara bersepadu untuk berkomunikasi dengan enjin SQL yang berbeza, dan ia berintegrasi dengan sangat baik dengan panda: anda mewujudkan enjin dengan URL sambungan, kemudian menyerahkannya kepada read_sql_query untuk menyediakan kerangka data untuk dianalisis.
Sebaik sahaja data berada dalam Python, statistik asas selalunya cukup untuk menarik perhatian pada temu bual peringkat penganalisis, seperti min, median, korelasi dan nisbah mudah. Anda tidak perlu menjadi ahli statistik tegar, tetapi anda harus selesa meringkaskan set data dan menerangkan apa yang tersirat dalam ringkasan tersebut.
Visualisasi dengan matplotlib atau seaborn biasanya tentang menghasilkan plot yang jelas dan boleh dibaca yang menyokong naratif anda, seperti histogram untuk memahami taburan atau carta garisan untuk memaparkan trend dari semasa ke semasa. Kejelasan jauh lebih penting daripada gaya mewah untuk tujuan temu bual.
Mengapa menggabungkan SQL dan Python merupakan kemahiran yang begitu hebat
Dari perspektif perniagaan, kuasa sebenar datang apabila anda menggabungkan pertanyaan SQL yang cekap dengan analisis fleksibel Python, dan bukannya menganggapnya sebagai dunia yang berasingan. SQL membolehkan anda memasukkan penapisan dan pengagregatan yang berat ke dalam pangkalan data, manakala Python membolehkan anda bereksperimen, memodelkan dan menggambarkannya.
SQL kekal sebagai standard de facto untuk pengurusan data hubungan atas sebab-sebab yang baik, termasuk pelaksanaan pertanyaan pantas pada jadual besar, perkakasan matang dan sokongan konsisten merentasi sistem utama seperti Asas transaksi MySQL, PostgreSQL, SQL Server atau Oracle. Dalam hampir setiap syarikat yang serius, sumber kebenaran anda terletak pada beberapa enjin SQL.
Python melengkapinya dengan menjadi pisau tentera Switzerland untuk semua yang berlaku selepas data meninggalkan pangkalan data, seperti membersihkan medan yang bersepah, membentuk semula jadual, mengesan anomali, membina papan pemuka, melatih model ML atau menjana laporan automatik.
Apabila anda menunjukkan bahawa anda boleh bermula dari soalan perniagaan, tulis SQL untuk mengekstrak data yang berkaitan dan kemudian gunakan Python untuk menggali lebih dalam, anda meletakkan diri anda sebagai penganalisis leveraj tinggi yang boleh memiliki keseluruhan bahagian kitaran hayat data dari hujung ke hujung.
Itulah sebabnya begitu banyak program latihan dan bootcamp menekankan SQL campur Python serta beberapa lapisan visualisasi, kerana susunan itu meliputi sebahagian besar kerja yang dilakukan oleh pasukan data praktikal yang berorientasikan perniagaan hari ini.
Menyambungkan Python ke pangkalan data SQL dalam praktik
Untuk benar-benar mengintegrasikan SQL dan Python dalam kerja anda, anda perlu tahu cara mewujudkan sambungan yang selamat dan boleh dipercayai antara skrip anda dan pangkalan data, supaya anda boleh menjalankan pertanyaan secara pengaturcaraan dan bukannya mengeksport CSV secara manual setiap masa.
Terdapat dua pendekatan umum: menggunakan penyambung aras rendah khusus untuk setiap pangkalan data atau menggunakan lapisan abstraksi seperti SQLAlchemy, yang bercakap dengan pemacu tersebut untuk anda. Untuk eksperimen pantas, penyambung ringan seperti sqlite3 sudah memadai; untuk aliran kerja gred pengeluaran, pasukan sering memilih SQLAlchemy dan pemacu asli seperti psycopg2 untuk PostgreSQL.
Aliran kerja biasa dengan pemacu seperti psycopg2 melibatkan pembacaan kelayakan daripada pembolehubah persekitaran, mencipta objek sambungan, membuka kursor, melaksanakan pertanyaan berparameter untuk mengelakkan suntikan SQL, mengulangi hasil, dan kemudian melakukan atau melancarkan semula seperti yang diperlukan sebelum menutup sambungan.
SQLAlchemy memudahkan sebahagian daripadanya dengan membolehkan anda membina URL pangkalan data, mencipta enjin dengan kolam sambungan, dan kemudian gunakan enjin tersebut untuk menjalankan pertanyaan melalui objek teks atau untuk dimasukkan terus ke dalam panda. Reka bentuk ini memudahkan pertukaran pangkalan data atau mengurus berbilang persekitaran (tempatan, pementasan, pengeluaran).
Sebaik sahaja corak sambungan anda tersedia, anda boleh mengautomasikan keseluruhan saluran data: jalankan pertanyaan SQL, muatkan hasilnya ke dalam kerangka data, melakukan pembersihan dan analisis, menjana laporan atau mengeksport CSV dan menjadualkan skrip untuk dijalankan setiap hari atau mingguan.
Amalan terbaik untuk keselamatan dan prestasi dalam aliran kerja SQL+Python
Setiap kali anda menyambungkan Python ke pangkalan data pengeluaran, anda perlu memikirkan dengan teliti tentang keselamatan, bermula dengan cara anda menyimpan dan mengakses kelayakan. Nama pengguna dan kata laluan pengekodan keras dalam skrip ialah anti-corak yang besar; sebaliknya, gunakan pembolehubah persekitaran atau pengurus rahsia khusus.
Pengurusan sambungan merupakan satu lagi aspek penting: membuka dan menutup sambungan baharu untuk setiap pertanyaan kecil boleh menjejaskan prestasi, terutamanya jika anda kerap menjalankan pertanyaan tersebut. Pengumpulan sambungan, yang disokong oleh SQLAlchemy secara langsung, membantu menggunakan semula sambungan yang telah dijalin dengan cekap.
Dari segi prestasi, kesilapan biasa adalah menarik lebih banyak data ke dalam Python daripada yang anda perlukan, dengan mengandaikan bahawa semuanya perlu dilakukan dengan panda. Pada hakikatnya, hampir selalu lebih baik untuk menolak penapisan, pengelompokan dan pengagregatan mudah ke pangkalan data, dan hanya memindahkan subset yang diproses yang benar-benar diperlukan.
Pengendalian ralat bukanlah sesuatu yang menarik tetapi ia penting, terutamanya apabila skrip anda berjalan tanpa pengawasan. Pastikan anda menangkap pengecualian berkaitan pangkalan data, merekodkan mesej yang bermakna dan mengembalikan transaksi jika berlaku masalah, supaya anda tidak meninggalkan sistem dalam keadaan yang tidak konsisten.
Amalan-amalan ini bukan sahaja memastikan persekitaran anda selamat dan responsif, Ia juga memberi isyarat kepada penemuduga bahawa anda memahami kekangan dunia sebenar melangkaui contoh mainan yang dihafal orang ramai untuk ujian pengekodan.
Menjalankan SQL dari Python dan menukarkan keputusan kepada analisis
Sebaik sahaja anda mempunyai sambungan yang stabil, langkah seterusnya ialah menjadikan pelaksanaan SQL daripada Python terasa semula jadi, supaya anda boleh berhenti berfikir dari segi alatan yang berasingan dan mula melihat satu aliran kerja bersepadu.
Dengan pemacu peringkat rendah, anda boleh menggunakan kursor dan set hasil, mengulang baris demi baris atau mengambil semua baris sekaligus. Dengan SQLAlchemy atau pustaka yang serupa, anda boleh melaksanakan pertanyaan teks dan mendapatkan objek peringkat lebih tinggi yang lebih mudah dimanipulasi dan dinyahpepijat.
Walau bagaimanapun, dalam kerja analitik, anda hampir sentiasa mahu menukar hasil pertanyaan terus ke dalam panda DataFrame, kerana struktur itu sesuai untuk menapis, menggabungkan, mengagregatkan dan akhirnya dimasukkan ke dalam visualisasi atau model.
Satu corak yang ampuh adalah dengan menganggap SQL sebagai alat "pengekstrakan dan pengagregatan kasar" anda dan panda sebagai persekitaran "transformasi dan penerokaan halus" anda, membolehkan setiap satu melakukan apa yang terbaik. Ini juga melindungi anda daripada meletupkan memori dengan cuba memanipulasi jadual mentah gergasi secara langsung dalam Python.
Contohnya, anda mungkin mempunyai pertanyaan SQL yang menghasilkan 20 produk teratas mengikut hasil, kemudian memasukkannya ke dalam panda untuk mengira nisbah tambahan, menyemak taburan atau mengintegrasikan dengan metadata produk daripada sumber lain sebelum mempersembahkannya.
Membersihkan, mengubah dan meneroka data dengan panda
Selepas memuatkan data daripada SQL ke dalam kerangka data, keutamaan pertama anda adalah untuk memahami kualiti dan strukturnya, bukan untuk terus terjerumus ke dalam pemodelan yang rumit. Ini bermakna menyemak nilai yang hilang, baris pendua, outlier yang mencurigakan dan mengesahkan jenis seperti tarikh dan medan berangka.
Pandas menyediakan kaedah yang sangat padat untuk tugas-tugas ini: anda boleh memeriksa kiraan nol, menggugurkan pendua, dan cipta lajur baharu yang mewakili metrik terbitan seperti margin, kadar pertumbuhan atau bendera segmentasi. Transformasi ini merupakan asas kepada analisis harian.
Apabila anda perlu memasukkan maklumat tambahan daripada jadual atau fail lain, Operasi penggabungan membolehkan anda menggabungkan set data seperti yang anda lakukan dengan gabungan dalam SQL. Keupayaan untuk membuat penaakulan tentang kardinaliti kekunci dan memilih gabungan dalaman berbanding kiri dengan betul adalah penting untuk mengelakkan ralat yang halus.
Fungsi statistik asas, selalunya dipinjam daripada numpy atau diintegrasikan ke dalam panda, memberi anda gambaran ringkas: min dan median mendedahkan kecenderungan pusat, korelasi menunjukkan bagaimana pembolehubah bergerak bersama, dan semakan kuantil mudah boleh mendedahkan nilai ekstrem yang memerlukan perhatian yang lebih dekat.
Penemuduga yang memberikan anda set data kecil dalam buku nota dan berkata “beritahu saya apa yang anda lihat” benar-benar menguji pemikiran penerokaan ini, bukan sama ada anda ingat ejaan tepat sesuatu fungsi. Bincangkan apa yang anda semak, mengapa anda menyemaknya dan apa maksud setiap pemerhatian dalam istilah perniagaan.
Daripada analisis kepada komunikasi: visualisasi dan pelaporan
Kerja analitik hanya bernilai senilai keupayaan anda untuk menyampaikan apa yang anda temui, Itulah sebabnya kemahiran visualisasi dan pelaporan penting walaupun dalam temu bual teknikal secara langsung. Pustaka plot Python memudahkan untuk menjana carta yang menyokong penjelasan anda.
Matplotlib dan seaborn memenuhi kebanyakan keperluan untuk senario temu bual: histogram untuk taburan, carta bar untuk perbandingan kategori dan plot garis untuk siri masa. Anda tidak perlu menghafal setiap parameter, tetapi anda harus tahu cara mendapatkan graf yang kelihatan baik dan melabelkan paksi dan tajuk dengan jelas.
Dari segi pelaporan, banyak kes penggunaan dunia sebenar melibatkan pengautomasikan penghasilan fail CSV atau Excel, kadangkala dijadualkan setiap hari, mingguan atau bulanan. Corak biasa adalah menjalankan pertanyaan SQL, memproses hasil dengan panda, kemudian mengeksport ke fail dengan nama yang dicop tarikh yang dikongsi dengan pihak berkepentingan.
Pelaporan automatik menghapuskan kerja manual yang berulang dan mengurangkan kesilapan manusia, sambil memastikan semua orang melihat definisi metrik yang konsisten setiap kali. Dalam temu bual, kebolehan untuk menerangkan bagaimana anda akan menyediakan saluran paip sedemikian adalah satu kelebihan yang besar.
Jika anda menambah visualisasi ke dalam campuran, anda juga boleh membayangkan skrip yang menjana plot dan membenamkannya ke dalam dek slaid atau papan pemuka, walaupun banyak pasukan hari ini menggunakan alat BI khusus untuk lapisan pembentangan akhir. Keupayaan untuk menyampaikan data yang bersih dan berstruktur dengan baik memudahkan langkah terakhir itu secara mendadak.
Kes dunia sebenar di mana SQL dan Python menyerlah bersama
Temu bual teknikal semakin mencerminkan masalah perniagaan sebenar, jadi adalah membantu untuk bersedia dengan contoh-contoh konkrit di mana menggabungkan SQL dan Python memberi anda kelebihan praktikal. Senario ini bukan sahaja menunjukkan kemahiran teknikal anda tetapi juga pemahaman anda tentang nilai perniagaan.
Satu kes penggunaan yang sangat biasa ialah pelaporan automatik: daripada menarik nombor secara manual daripada pangkalan data, Anda menjadualkan skrip Python yang membuat pertanyaan pada pangkalan data dengan SQL, mengagregatkan data, memformatnya dan menyimpan atau menghantar laporan akhir. Ini merupakan peningkatan produktiviti yang besar berbanding aliran kerja hamparan sahaja.
Pengendalian data dalam jumlah yang besar merupakan satu lagi tema penting, terutamanya dalam syarikat yang mempunyai berjuta-juta transaksi. Di sini, SQL bertanggungjawab untuk kerja-kerja berat (penapisan, pengelompokan, perumusan), manakala Python mengendalikan analitik yang lebih rumit pada set data yang dikurangkan, seperti mengira KPI lanjutan atau menyegmentasikan pelanggan.
Apabila sesebuah syarikat ingin beralih kepada pemodelan ramalan, kombinasi SQL+Python sekali lagi menjadi keutamaan, dengan SQL menyediakan jadual ciri dan Python menggunakan pustaka seperti scikit-learn untuk melatih model pengelasan atau regresi. Ini mungkin termasuk ramalan churn, pengesanan penipuan atau sistem cadangan.
Dalam semua contoh ini, coraknya konsisten: SQL menyediakan data dengan cekap di tempat ia berada, Python mengubah dan mentafsirkannya, dan penganalisis duduk di tengah, membuat keputusan reka bentuk dan menghubungkan output teknikal dengan matlamat perniagaan.
Jika anda memasuki temu duga SQL dan Python anda dengan pemahaman yang jelas tentang konsep-konsep ini, jangkaan yang realistik tentang tahap kod yang akan diminta untuk anda tulis, dan banyak latihan menggabungkan pertanyaan SQL bersama-sama dengan aliran kerja panda, Anda akan berada dalam kedudukan yang lebih kukuh untuk menunjukkan bahawa anda bukan sahaja menghafal sintaks, tetapi sebenarnya berfikir seperti seorang profesional data yang boleh menambah nilai dari hari pertama.