Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


3
Bagaimana cara mensimulasikan data agar signifikan secara statistik?
Saya di kelas 10 dan saya sedang mencari untuk mensimulasikan data untuk proyek pembelajaran sains mesin adil. Model akhir akan digunakan pada data pasien dan akan memprediksi korelasi antara waktu-waktu tertentu dalam seminggu dan efeknya terhadap kepatuhan pengobatan dalam data satu pasien. Nilai kepatuhan adalah biner (0 berarti mereka tidak …



7
Bias Data dalam Pembelajaran Mesin
Saya sedang mengerjakan proyek Machine Learning dengan data yang sudah (berat) bias oleh pemilihan data. Mari kita asumsikan Anda memiliki seperangkat aturan kode keras. Bagaimana Anda membangun model pembelajaran mesin untuk menggantinya, ketika semua data yang dapat digunakan adalah data yang sudah disaring oleh aturan-aturan itu? Untuk memperjelas, saya kira …

3
Model ikonik (mainan) dari jaringan saraf
Profesor fisika saya di sekolah pascasarjana, serta peraih Noble Feynman, akan selalu menyajikan apa yang mereka sebut model mainan untuk menggambarkan konsep dasar dan metode dalam fisika, seperti osilator harmonik, pendulum, spinning top, dan kotak hitam. Model mainan apa yang digunakan untuk menggambarkan konsep dasar dan metode yang mendasari penerapan …

11
Istilah untuk "jumlah kolom" dari sebuah matriks
Apakah ada satu kata bahasa Inggris untuk menunjukkan "jumlah kolom" dari suatu matriks? Misalnya, "dimensi" dari matriks . Saya perlu istilah untuk dalam contoh ini. Saya selalu bisa mengatakan "jumlah kolom", tentu saja, tetapi bisakah saya memiliki satu kata untuk itu?2 × 32×32\times 32 × 32×32\times 3333

6
Regresi linier atau regresi logistik ordinal untuk memprediksi peringkat anggur (dari 0 dan 10)
Saya memiliki data anggur dari sini yang terdiri dari 11 variabel independen numerik dengan peringkat dependen terkait dengan setiap entri dengan nilai antara 0 dan 10. Ini membuatnya menjadi dataset yang bagus untuk menggunakan model regresi untuk menyelidiki hubungan antara variabel dan yang terkait peringkat. Namun, apakah regresi linier sesuai, …

4
Motivasi teoretis untuk menggunakan log-likelihood vs likelihood
Saya mencoba memahami pada tingkat yang lebih dalam tentang keberadaan log-likelihood (dan mungkin lebih umum log-probability) dalam statistik dan teori probabilitas. Log-probabilitas muncul di semua tempat: kami biasanya bekerja dengan log-kemungkinan untuk analisis (misalnya untuk maksimalisasi), informasi Fisher didefinisikan dalam hal turunan kedua dari log-kemungkinan, entropi adalah log-probabilitas yang diharapkan …

1
Mengapa t-test dan ANOVA memberikan nilai p yang berbeda untuk perbandingan dua kelompok?
Dalam artikel Wikipedia tentang ANOVA , katanya Dalam bentuknya yang paling sederhana, ANOVA memberikan uji statistik apakah rata-rata beberapa kelompok sama atau tidak, dan oleh karena itu menggeneralisasikan uji-t ke lebih dari dua kelompok. Pemahaman saya tentang ini adalah bahwa ANOVA sama dengan uji-t ketika menyangkut perbandingan dua kelompok. Namun, …

4
Mengapa Q-Learning menggunakan epsilon-serakah selama pengujian?
Dalam makalah DeepMind tentang video game Deep Q-Learning untuk Atari (di sini ), mereka menggunakan metode epsilon-serakah untuk eksplorasi selama pelatihan. Ini berarti bahwa ketika suatu tindakan dipilih dalam pelatihan, tindakan tersebut dapat dipilih sebagai tindakan dengan nilai q tertinggi, atau tindakan acak. Memilih antara keduanya adalah acak dan berdasarkan …


2
Apakah ada asumsi awal tentang regresi logistik?
Apakah ada asumsi awal pada variabel respon regresi logistik? Sebagai contoh, misalkan kita memiliki titik data. Tampaknya respons datang dari distribusi Bernoulli dengan . Karena itu, kita harus memiliki distribusi Bernoulli, dengan parameter berbeda .100010001000YsayaYsayaY_ihalsaya= logit ( β0+ β1xsaya)halsaya=logit(β0+β1xsaya)p_i=\text{logit}(\beta_0+\beta_1 x_i)100010001000halhalp Jadi, mereka "independen", tetapi tidak "identik". Apakah saya benar? PS. …

5
Apakah statistik Bayesian membuat meta-analisis usang?
Saya hanya ingin tahu apakah statistik Bayesian akan diterapkan secara konsekuen dari studi pertama hingga terakhir jika ini membuat meta-analisis usang. Sebagai contoh, mari kita asumsikan 20 studi yang telah dilakukan pada titik waktu yang berbeda. Perkiraan atau distribusi studi pertama dilakukan dengan informasi sebelumnya yang tidak informatif . Studi …

2
Misalkan
Apa cara termudah untuk melihat bahwa pernyataan berikut ini benar? Misalkan Y1,…,Yn∼iidExp(1)Y1,…,Yn∼iidExp(1)Y_1, \dots, Y_n \overset{\text{iid}}{\sim} \text{Exp}(1) . Perlihatkan ∑ni=1(Yi−Y(1))∼Gamma(n−1,1)∑i=1n(Yi−Y(1))∼Gamma(n−1,1)\sum_{i=1}^{n}(Y_i - Y_{(1)}) \sim \text{Gamma}(n-1, 1) . Y(1)=min1≤i≤nYiY(1)=min1≤i≤nYiY_{(1)} = \min\limits_{1 \leq i \leq n}Y_i Dengan , ini berarti bahwa .X∼Exp(β)X∼Exp(β)X \sim \text{Exp}(\beta)fX(x)=1βe−x/β⋅1{x>0}fX(x)=1βe−x/β⋅1{x>0}f_{X}(x) = \dfrac{1}{\beta}e^{-x/\beta} \cdot \mathbf{1}_{\{x > 0\}} Mudah untuk melihat . …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.