Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

3
Kapan interval kepercayaan "masuk akal" tetapi interval kredibel yang sesuai tidak?
Sering terjadi bahwa interval kepercayaan dengan cakupan 95% sangat mirip dengan interval kredibel yang mengandung 95% dari kepadatan posterior. Ini terjadi ketika yang sebelumnya seragam atau hampir seragam dalam kasus yang terakhir. Dengan demikian interval kepercayaan sering dapat digunakan untuk memperkirakan interval yang kredibel dan sebaliknya. Yang penting, kita dapat …

2
Contoh statistik yang tidak independen dari distribusi sampel?
Ini adalah definisi untuk statistik di wikipedia Secara lebih formal, teori statistik mendefinisikan statistik sebagai fungsi sampel di mana fungsi itu sendiri tidak tergantung pada distribusi sampel; artinya, fungsi dapat dinyatakan sebelum realisasi data. Istilah statistik digunakan untuk fungsi dan nilai fungsi pada sampel yang diberikan. Saya pikir saya mengerti …

2
Bisakah saya menggunakan momen distribusi untuk mencicipi distribusi?
Saya perhatikan dalam metode pembelajaran statistik / mesin, distribusi sering kali diperkirakan oleh seorang Gaussian, dan kemudian bahwa Gaussian digunakan untuk pengambilan sampel. Mereka mulai dengan menghitung dua momen pertama dari distribusi, dan menggunakannya untuk memperkirakan μμ\mu dan σ2σ2\sigma^2 . Kemudian mereka dapat mencicipi dari Gaussian itu. Bagi saya, semakin …

5
Bagaimana saya menghitung apakah regresi linier saya memiliki perbedaan yang signifikan secara statistik dari garis teoretis yang diketahui?
Saya punya beberapa data yang sesuai dengan garis linear: Ketika saya melakukan regresi linier dari nilai-nilai ini, saya mendapatkan persamaan linear: y= 0,997 x - 0,0136y=0,997x-0,0136y = 0.997x-0.0136 Dalam dunia yang ideal, persamaan harus menjadi y= xy=xy = x . Jelas, nilai linear saya dekat dengan ideal itu, tetapi tidak …


2
Apakah distribusi Cauchy bagaimanapun juga merupakan distribusi yang “tidak dapat diprediksi”?
Apakah distribusi Cauchy bagaimanapun juga merupakan distribusi yang "tidak dapat diprediksi"? Saya mencoba melakukannya cs <- function(n) { return(rcauchy(n,0,1)) } di R untuk banyak nilai n dan perhatikan bahwa mereka menghasilkan nilai yang cukup tidak terduga kadang-kadang. Bandingkan dengan misalnya as <- function(n) { return(rnorm(n,0,1)) } yang sepertinya selalu memberi …

3
Jika adalah IID, maka hitung , di mana
Pertanyaan Jika adalah IID, maka hitung , di mana .X1,⋯,Xn∼N(μ,1)X1,⋯,Xn∼N(μ,1)X_1,\cdots,X_n \sim \mathcal{N}(\mu, 1)E(X1∣T)E(X1∣T)\mathbb{E}\left( X_1 \mid T \right)T=∑iXiT=∑iXiT = \sum_i X_i Coba : Silakan periksa apakah di bawah ini benar. Katakanlah, kita mengambil penjumlahan dari harapan bersyarat itu sehingga, Ini berarti bahwa setiap sejak X_1, \ ldots, X_n adalah IID.∑iE(Xi∣T)=E(∑iXi∣T)=T.∑iE(Xi∣T)=E(∑iXi∣T)=T.\begin{align} \sum_i …

1
Kedalaman pohon keputusan
Karena algoritma pohon keputusan terpecah pada suatu atribut pada setiap langkah, kedalaman maksimum pohon keputusan sama dengan jumlah atribut data. Apakah ini benar?

6
Statistik yang lebih penting: '90 persen dari semua perempuan selamat 'atau '90 persen dari semua yang selamat adalah perempuan'?
Pertimbangkan pernyataan berikut tentang Titanic: Asumsi 1: Hanya pria dan wanita yang ada di kapal Asumsi 2: Ada banyak pria dan wanita Pernyataan 1: 90 persen dari semua wanita selamat Pernyataan 2: 90 persen dari semua yang selamat, adalah perempuan Yang pertama menunjukkan bahwa menyelamatkan perempuan mungkin dari prioritas tinggi …

1
Algoritma pengantongan apa yang merupakan penerus yang layak untuk Random Forest?
Untuk meningkatkan algoritma, saya akan mengatakan bahwa mereka berevolusi dengan cukup baik. Pada awal 1995 AdaBoost diperkenalkan, kemudian setelah beberapa waktu itu Gradient Boosting Machine (GBM). Baru-baru ini, sekitar 2015 XGBoost diperkenalkan, yang akurat, menangani overfitting dan telah menjadi pemenang beberapa kompetisi Kaggle. Pada 2017 LightGBM diperkenalkan oleh Microsoft, ia …

3
Nasihat tentang kolaborasi dengan ilmuwan terapan
Saya seorang mahasiswa pascasarjana dalam statistik dan karena itu terlibat dalam beberapa kolaborasi dengan ilmuwan terapan (ekonom, rimbawan, ...). Kolaborasi ini menyenangkan (sebagian besar waktu) dan saya belajar banyak, tetapi ada juga beberapa komplikasi, misalnya: Terkadang pandangan saya tentang apa model statistik yang baik berbeda dari latar belakang kolaborator saya …
14 references 

4
Model prediksi: statistik tidak mungkin mengalahkan pembelajaran mesin? [Tutup]
Ditutup . Pertanyaan ini perlu lebih fokus . Saat ini tidak menerima jawaban. Ingin meningkatkan pertanyaan ini? Perbarui pertanyaan sehingga berfokus pada satu masalah hanya dengan mengedit posting ini . Ditutup 2 tahun yang lalu . Saat ini saya mengikuti program magister yang berfokus pada statistik / ekonometrika. Di master …

1
Mengapa kita tidak menggunakan laju pembelajaran non-konstan untuk gradien yang layak untuk hal-hal lain selain jaringan saraf?
Literatur pembelajaran yang mendalam penuh dengan trik pintar dengan menggunakan tingkat pembelajaran yang tidak konstan dalam gradient descent. Hal-hal seperti peluruhan eksponensial, RMSprop, Adagrad dll mudah untuk diimplementasikan dan tersedia di setiap paket pembelajaran yang mendalam, namun mereka tampaknya tidak ada di luar jaringan saraf. Apakah ada alasan untuk ini? …

1
Hamiltonian Monte Carlo untuk boneka
Bisakah Anda memberikan langkah-demi-langkah untuk penjelasan boneka tentang bagaimana Hamiltonian Monte Carlo bekerja? PS: Saya sudah membaca jawabannya di sini, Hamiltonian monte carlo , dan di sini, Hamiltonian Monte Carlo vs. Sequential Monte Carlo , dan di sini, Hamiltonian Monte Carlo: bagaimana memahami proposal Metropolis-Hasting? dan mereka tidak mengatasinya secara …
14 bayesian  hmc 

6
Nitpicking tentang penggunaan aktif / pasif dari "berkorelasi"
Saya ragu apakah akan menanyakan hal ini di sini di statistik StackExchange atau di linguistik / bahasa Inggris, tapi saya rasa mungkin ada lebih banyak pengguna yang menyukai bahasa di sini daripada pengguna yang mengerti statistik di forum lain;) Saya sering membaca laporan yang menyebutkan korelasi sebagai kata kerja dalam …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.