Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Informasi Reksa sebagai probabilitas
Dapatkah informasi timbal balik melalui entropi bersama: 0≤I(X,Y)H(X,Y)≤10≤I(X,Y)H(X,Y)≤1 0 \leq \frac{I(X,Y)}{H(X,Y)} \leq 1 didefinisikan sebagai: "Peluang menyampaikan informasi dari X ke Y"? Saya minta maaf karena begitu naif, tetapi saya belum pernah mempelajari teori informasi, dan saya mencoba hanya untuk memahami beberapa konsep tentang itu.


1
RandomForest dan bobot kelas
Pertanyaan dalam satu kalimat: Apakah ada yang tahu cara menentukan bobot kelas yang baik untuk hutan acak? Penjelasan: Saya bermain-main dengan dataset yang tidak seimbang. Saya ingin menggunakan Rpaket randomForestuntuk melatih model pada dataset yang sangat miring dengan hanya sedikit contoh positif dan banyak contoh negatif. Saya tahu, ada metode …
11 r  random-forest 

1
Metode lonjakan dan lempengan Bayesian versus hukuman
Saya membaca slide Steven Scott tentang paket BSTS R (Anda dapat menemukannya di sini: slide ). Pada titik tertentu, ketika berbicara tentang memasukkan banyak regressor dalam model deret waktu struktural ia memperkenalkan spike dan slab prior dari koefisien regresi dan mengatakan bahwa mereka lebih baik dibandingkan dengan metode hukuman. Scott …

1
Mengapa Netflix akan beralih dari sistem peringkat bintang lima ke sistem suka / tidak suka?
Netflix digunakan untuk mendasarkan sarannya pada peringkat yang dikirimkan pengguna dari film / acara lain. Sistem peringkat ini memiliki lima bintang. Sekarang, Netflix memungkinkan pengguna untuk menyukai / tidak suka (acungan jempol / jempol) film / pertunjukan. Mereka mengklaim lebih mudah untuk menilai film. Bukankah klasifikasi 2 arah ini secara …

2
Haruskah saya melaporkan hasil yang tidak signifikan?
Saya sudah menjalankan tes Kruskal Wallis, dan untuk beberapa pertanyaan nilai p tidak signifikan. Apakah saya akan melaporkan ini dengan cara yang sama seolah-olah signifikan, menyatakan df, statistik uji dan nilai-p? Jadi itu akan menjadi seperti ini tes Kruskal Wallis dilakukan tetapi hasilnya ditemukan tidak signifikan H (3) = 2,119, …


1
Bagaimana menafsirkan hasil ketika ridge dan laso secara terpisah berkinerja baik tetapi menghasilkan koefisien yang berbeda
Saya menjalankan model regresi baik dengan Lasso dan Ridge (untuk memprediksi variabel hasil diskrit mulai dari 0-5). Sebelum menjalankan model, saya menggunakan SelectKBestmetode scikit-learnuntuk mengurangi set fitur dari 250 menjadi 25 . Tanpa pemilihan fitur awal, Lasso dan Ridge menghasilkan skor akurasi yang lebih rendah [yang mungkin disebabkan oleh ukuran …



2
Jika Anda tidak dapat melakukannya secara orthogonal, lakukan mentah (regresi polinomial)
Saat melakukan regresi polinomial untuk ke , orang terkadang menggunakan polinomial mentah, terkadang polinomial ortogonal. Tetapi ketika mereka menggunakan apa yang tampaknya sepenuhnya sewenang-wenang.XYYYXXX Di sini dan di sini polinomial mentah digunakan. Tetapi di sini dan di sini , polinomial ortogonal tampaknya memberikan hasil yang benar. Apa, bagaimana, mengapa ?! …

2
Representasi ruang negara ARMA (p, q) dari Hamilton
Saya telah membaca Hamilton Bab 13 dan dia memiliki representasi ruang keadaan berikut untuk ARMA (p, q). Misalkan Maka proses ARMA (p, q) adalah sebagai berikut: Lalu, ia mendefinisikan Persamaan Negara sebagai berikut:r=max(p,q+1)r=max(p,q+1)r = \max(p,q+1)yt−μ=ϕ1(yt−1−μ)+ϕ2(yt−2−μ)+...+ϕ3(yt−3−μ)+ϵt+θ1ϵt−1+...+θr−1ϵt−r+1.yt−μ=ϕ1(yt−1−μ)+ϕ2(yt−2−μ)+...+ϕ3(yt−3−μ)+ϵt+θ1ϵt−1+...+θr−1ϵt−r+1. \begin{aligned} y_t -\mu &= \phi_1(y_{t-1} -\mu) + \phi_2(y_{t-2} -\mu) + ... + \phi_3(y_{t-3} -\mu) \\ …

1
Batas generalisasi pada SVM
Saya tertarik pada hasil teoretis untuk kemampuan generalisasi dari Support Vector Machines, misalnya terikat pada probabilitas kesalahan klasifikasi dan pada dimensi Vapnik-Chervonenkis (VC) dari mesin-mesin ini. Namun, membaca literatur saya memiliki kesan bahwa beberapa hasil berulang yang serupa cenderung sedikit berbeda dari penulis ke penulis, terutama mengenai kondisi teknis yang …


2
Pembelajaran terawasi dengan data tidak pasti?
Apakah ada metodologi yang ada untuk menerapkan model pembelajaran yang diawasi ke dataset yang tidak pasti? Misalnya, kita memiliki dataset dengan kelas A dan B: +----------+----------+-------+-----------+ | FeatureA | FeatureB | Label | Certainty | +----------+----------+-------+-----------+ | 2 | 3 | A | 50% | | 3 | 1 | …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.