Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Asimtotik Sampling Hypercube Latin
Saya mencoba membangun bukti untuk masalah yang sedang saya kerjakan dan salah satu asumsi yang saya buat adalah bahwa kumpulan poin yang saya ambil sampel padat di seluruh ruang. Secara praktis, saya menggunakan pengambilan sampel Latin Hypercube untuk mendapatkan poin saya di seluruh ruang sampel. Yang ingin saya ketahui adalah …

3
Merencanakan hasil hanya memiliki mean dan standar deviasi
Saya mencoba memvisualisasikan plot yang sesuai untuk pengamatan pada tabel rata-rata dan standar deviasi skor recall ini: PenarikanKontrolBerarti37SD8EksperimentalBerarti21SD6KontrolEksperimentalBerartiSDBerartiSDPenarikan378216\begin{array} {c|c c|c c|} & \text{Control} & & \text{Experimental} & \\ & \text{Mean} & \text{SD} &\text{Mean} &\text{SD} \\ \hline \text{Recall} & 37 & 8 & 21 & 6 \\ \hline \end{array} Apa cara …


1
Memilih rentang dan kerapatan jaringan untuk parameter regularisasi di LASSO
Saya sedang mempelajari LASSO (setidaknya penyusutan absolut dan operator seleksi) sementara itu. Saya melihat bahwa nilai optimal untuk parameter regularisasi dapat dipilih dengan validasi silang. Saya melihat juga dalam regresi ridge dan banyak metode yang menerapkan regularisasi, kita dapat menggunakan CV untuk menemukan parameter regularisasi yang optimal (mengatakan penalti). Sekarang …

1
Bagaimana cara memasukkan perkiraan PDF (yaitu: estimasi kepadatan) menggunakan momen k (empiris) pertama?
Saya memiliki situasi di mana saya dapat memperkirakan (yang pertama) kkk momen dari kumpulan data, dan ingin menggunakannya untuk menghasilkan estimasi fungsi kerapatan. Saya sudah menemukan distribusi Pearson , tetapi menyadari itu hanya bergantung pada 4 momen pertama (dengan beberapa pembatasan pada kemungkinan kombinasi momen). Saya juga mengerti bahwa setiap …

1
Algoritma penyematan kata dalam hal kinerja
Saya mencoba menanamkan sekitar 60 juta frasa ke dalam ruang vektor , lalu menghitung persamaan cosinus di antara mereka. Saya telah menggunakan sklearn's CountVectorizerdengan fungsi tokenizer yang dibuat khusus yang menghasilkan unigrams dan bigrams. Ternyata untuk mendapatkan representasi yang bermakna, saya harus mengizinkan sejumlah besar kolom, linier dalam jumlah baris. …

1
Nilai p bootstrap non-parametrik vs interval kepercayaan
Konteks Ini agak mirip dengan pertanyaan ini , tetapi saya tidak berpikir itu adalah duplikat yang tepat. Ketika Anda mencari instruksi bagaimana melakukan tes hipotesis bootstrap, biasanya dinyatakan bahwa boleh saja menggunakan distribusi empiris untuk interval kepercayaan tetapi Anda perlu mem-bootstrap dengan benar dari distribusi di bawah hipotesis nol untuk …

1
Mengapa pemilihan fitur penting, untuk tugas klasifikasi?
Saya belajar tentang pemilihan fitur. Saya bisa melihat mengapa itu penting dan bermanfaat, untuk pembuatan model. Tetapi mari kita fokus pada tugas-tugas pembelajaran (klasifikasi) yang diawasi. Mengapa pemilihan fitur penting, untuk tugas klasifikasi? Saya melihat banyak literatur yang ditulis tentang pemilihan fitur dan penggunaannya untuk pembelajaran yang diawasi, tetapi ini …

3
Apa manfaat dari berbagai pendekatan untuk mendeteksi collinearity?
Saya ingin mendeteksi apakah collinearity merupakan masalah dalam regresi OLS saya. Saya memahami bahwa varians faktor inflasi dan indeks kondisi adalah dua ukuran yang umum digunakan, tetapi saya merasa kesulitan untuk menemukan sesuatu yang pasti pada manfaat dari setiap pendekatan, atau berapa skor yang seharusnya. Sumber terkemuka yang menunjukkan pendekatan …

1
Apa cara yang tepat untuk menghitung estimasi kepadatan kernel dari koordinat geografis?
Saya harus menghitung estimasi kepadatan kernel 2d (KDE) dari daftar koordinat lintang dan bujur. Tetapi satu derajat dalam garis lintang tidak sama dengan satu derajat dalam garis bujur, ini berarti bahwa masing-masing kernel akan berbentuk oval, khususnya titik selanjutnya dari khatulistiwa. Dalam kasus saya, semua titik cukup dekat satu sama …

1
Apa sifat statistik 'yang diinginkan' dari tes rasio kemungkinan?
Saya membaca artikel yang metodenya sepenuhnya berdasarkan uji rasio kemungkinan. Penulis mengatakan bahwa uji LR terhadap alternatif satu sisi adalah UMP. Dia melanjutkan dengan mengklaim itu "... bahkan ketika [tes LR] tidak dapat ditunjukkan paling kuat secara seragam, tes LR sering memiliki sifat statistik yang diinginkan." Saya bertanya-tanya apa sifat …


2
Menggabungkan pengamatan dalam Proses Gaussian
Saya menggunakan proses Gaussian (GP) untuk regresi. Dalam masalah saya, cukup umum untuk dua atau lebih titik data saling berdekatan, relatif dengan panjangnya skala masalah. Juga, pengamatan bisa sangat bising. Untuk mempercepat perhitungan dan meningkatkan presisi pengukuran , tampaknya wajar untuk menggabungkan / mengintegrasikan kelompok titik yang dekat satu sama …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.