Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

5
Contoh PCA di mana PC dengan varian rendah "berguna"
Biasanya dalam analisis komponen utama (PCA) beberapa PC pertama digunakan dan PC varians rendah dijatuhkan, karena mereka tidak menjelaskan banyak variasi dalam data. Namun, adakah contoh di mana PC dengan variasi rendah bermanfaat (yaitu menggunakan dalam konteks data, memiliki penjelasan intuitif, dll.) Dan tidak boleh dibuang?
24 pca 

2
Mengapa algoritma Expectation Maximization dijamin untuk menyatu ke optimal lokal?
Saya telah membaca beberapa penjelasan tentang algoritma EM (misalnya dari Pengenalan Pola Bishop dan Pembelajaran Mesin dan dari Kursus Pertama Roger dan Gerolami tentang Pembelajaran Mesin). Derivasi EM itu ok, saya mengerti. Saya juga mengerti mengapa algoritma menutupi sesuatu: pada setiap langkah kita meningkatkan hasil dan kemungkinan dibatasi oleh 1.0, …

5
Apa keuntungan dari memperlakukan faktor sebagai acak dalam model campuran?
Saya memiliki masalah dalam merangkul manfaat pemberian label faktor model secara acak karena beberapa alasan. Bagi saya sepertinya dalam hampir semua kasus solusi optimal adalah memperlakukan semua faktor sebagai tetap. Pertama, perbedaan fixed vs random cukup arbitrer. Penjelasan standar adalah bahwa, jika seseorang tertarik pada unit eksperimen tertentu, maka ia …


4
Apakah Shapiro-Wilk adalah tes normalitas terbaik? Mengapa mungkin lebih baik daripada tes lain seperti Anderson-Darling?
Saya telah membaca di suatu tempat dalam literatur bahwa tes Shapiro-Wilk dianggap sebagai tes normalitas terbaik karena untuk tingkat signifikansi yang diberikan, , probabilitas menolak hipotesis nol jika itu salah lebih tinggi daripada dalam kasus yang lain tes normalitas.αα\alpha Bisakah Anda jelaskan kepada saya, menggunakan argumen matematis jika memungkinkan, bagaimana …

3
Validasi silang atau bootstrap untuk mengevaluasi kinerja klasifikasi?
Apa metode pengambilan sampel yang paling tepat untuk mengevaluasi kinerja classifier pada set data tertentu dan membandingkannya dengan classifier lain? Cross-validasi tampaknya menjadi praktik standar, tetapi saya telah membaca bahwa metode seperti .632 bootstrap adalah pilihan yang lebih baik. Sebagai tindak lanjut: Apakah pilihan metrik kinerja memengaruhi jawaban (jika saya …


2
Dalam analisis survival, mengapa kita menggunakan model semi-parametrik (bahaya proporsional Cox) alih-alih model sepenuhnya parametrik?
Pertanyaan ini dimigrasikan dari Mathematics Stack Exchange karena dapat dijawab di Cross Validated. Bermigrasi 6 tahun yang lalu . Saya telah mempelajari model Cox Proportional Hazards, dan pertanyaan ini dibahas di sebagian besar teks. Cox mengusulkan menyesuaikan koefisien fungsi Bahaya menggunakan metode kemungkinan parsial, tetapi mengapa tidak hanya sesuai dengan …

2
Berapa besar set pelatihan yang dibutuhkan?
Apakah ada metode umum yang digunakan untuk menentukan berapa banyak sampel pelatihan yang diperlukan untuk melatih classifier (LDA dalam kasus ini) untuk mendapatkan akurasi generalisasi ambang batas minimum? Saya bertanya karena saya ingin meminimalkan waktu kalibrasi yang biasanya diperlukan dalam antarmuka otak-komputer.


1
Standar deviasi pengamatan binned
Saya memiliki dataset pengamatan sampel, disimpan sebagai jumlah dalam jangkauan sampah. misalnya: min/max count 40/44 1 45/49 2 50/54 3 55/59 4 70/74 1 Sekarang, menemukan perkiraan rata-rata dari ini cukup mudah. Cukup gunakan rata-rata (atau median) dari masing-masing rentang bin sebagai pengamatan dan menghitung sebagai bobot dan temukan rata-rata …

3
Menentukan berbagai kelompok data 1d dari basis data
Saya memiliki tabel transfer data antara node yang berbeda. Ini adalah basis data yang sangat besar (dengan hampir 40 juta transfer). Salah satu atribut adalah jumlah byte (nbytes) transfer yang berkisar dari 0 byte hingga 2 tera byte. Saya ingin mengelompokkan nbytes sehingga diberikan k cluster beberapa transfer x1 milik …

2
Bagaimana merancang dan mengimplementasikan fungsi kerugian asimetris untuk regresi?
Masalah Dalam regresi satu biasanya menghitung mean squared error (MSE) untuk sampel: untuk mengukur kualitas prediktor.MSE = 1n∑i = 1n( g( xsaya) - gˆ( xsaya) )2MSE=1n∑saya=1n(g(xsaya)-g^(xsaya))2 \text{MSE} = \frac{1}{n} \sum_{i=1}^n\left(g(x_i) - \widehat{g}(x_i)\right)^2 Saat ini saya sedang mengerjakan masalah regresi di mana tujuannya adalah untuk memprediksi harga yang bersedia dibayar oleh …


1
Bagaimana cara menentukan kondisi terminasi untuk gradient descent?
Sebenarnya, saya ingin bertanya kepada Anda bagaimana saya bisa menentukan kondisi terminating untuk gradient descent. Dapatkah saya menghentikannya berdasarkan jumlah iterasi, yaitu mempertimbangkan nilai parameter untuk, katakanlah, 100 iterasi? Atau haruskah saya menunggu sedemikian rupa sehingga perbedaan dalam dua nilai parameter 'baru' dan 'lama' sangat kecil untuk urutan katakanlah ? …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.