Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Apakah pohon CART menangkap interaksi di antara para prediktor?
Makalah ini mengklaim bahwa dalam CART, karena pemisahan biner dilakukan pada kovariat tunggal pada setiap langkah, semua pemisahan bersifat ortogonal dan oleh karena itu interaksi di antara kovariat tidak dipertimbangkan. Namun, banyak referensi yang sangat serius mengklaim, sebaliknya, bahwa struktur hierarki pohon menjamin bahwa interaksi antara para prediktor secara otomatis …

4
Uji pasti Fisher pada data berpasangan
Diberikan kasus dengan kanker paru-paru dan kontrol yang cocok (tanpa kanker paru-paru) (pencocokan berdasarkan usia, jenis kelamin, dll). Untuk mencoba menemukan bukti antara efek merokok pada kanker paru-paru, saya menggunakan tes Fisher pada tabel kontingensi. Namun ini tidak memperhitungkan bahwa kontrol dan kasus dicocokkan. 404040404040 Jadi saya bertanya-tanya apakah ada …


2
Bagaimana saya bisa menggunakan data ini untuk mengkalibrasi penanda dengan berbagai tingkat kedermawanan dalam menilai makalah siswa?
12 guru mengajar 600 siswa. 12 kohort yang diajarkan oleh guru-guru ini memiliki ukuran dari 40 hingga 90 siswa, dan kami mengharapkan perbedaan sistematis antara kohort, karena siswa pascasarjana dialokasikan secara tidak proporsional ke kohort tertentu, dan pengalaman sebelumnya telah menunjukkan bahwa skor rata-rata siswa pascasarjana jauh lebih tinggi daripada …

5
Pengujian Hipotesis Poisson untuk Dua Parameter
Jadi, untuk bersenang-senang, saya mengambil beberapa data panggilan dari call center tempat saya bekerja dan mencoba melakukan beberapa pengujian hipotesis pada mereka, khususnya jumlah panggilan yang diterima dalam seminggu, dan menggunakan distribusi Poisson agar sesuai. Karena subjek pekerjaan saya, ada dua jenis minggu, mari kita panggil salah satu dari mereka …

1
Penggunaan teori informasi dalam ilmu data terapan
Hari ini saya membaca buku "Teori Informasi: Pengantar tutorial" oleh James Stone dan berpikir sejenak tentang sejauh mana penggunaan teori informasi dalam ilmu data terapan (jika Anda tidak nyaman dengan istilah yang masih agak kabur ini, berpikir analisis data , yang ilmu data IMHO adalah versi dimuliakan). Saya menyadari penggunaan …

2
Bagaimana cara mewakili penggunaan kWh per tahun terhadap suhu rata-rata?
Hanya untuk bersenang-senang, saya ingin memetakan konsumsi daya rumah tangga bulanan saya dari tahun ke tahun. Namun, saya ingin memasukkan beberapa referensi untuk suhu bulanan sehingga saya dapat menentukan apakah rumah atau perilaku saya membaik, memburuk, atau tetap stabil dalam hal penggunaan kWh. Data yang saya kerjakan: +----------+--------+-----------+----------------+----------+-----------+------------+ | Month …


4
Jumlah gulungan dadu yang diharapkan perlu menghasilkan jumlah yang lebih besar atau sama dengan K?
Dadu 6 sisi digulung berulang-ulang. Berapa jumlah gulungan yang diharapkan untuk menghasilkan jumlah yang lebih besar dari atau sama dengan K? Sebelum Mengedit P(Sum>=1 in exactly 1 roll)=1 P(Sum>=2 in exactly 1 roll)=5/6 P(Sum>=2 in exactly 2 rolls)=1/6 P(Sum>=3 in exactly 1 roll)=5/6 P(Sum>=3 in exactly 2 rolls)=2/6 P(Sum>=3 in …

1
Apa perbedaan antara pengondisian pada regresor dan memperlakukan mereka sebagai tetap?
Kadang-kadang kita mengasumsikan bahwa regressor adalah tetap, yaitu mereka non-stokastik. Saya pikir itu berarti semua prediktor, estimasi parameter, dll. Tanpa syarat, kan? Mungkinkah saya melangkah lebih jauh sehingga mereka bukan lagi variabel acak? Jika di sisi lain kita menerima bahwa sebagian besar pelaku regresi dalam bidang ekonomi mengatakan stokastik karena …

2
Apakah OLS Efisien Asimptotik Di Bawah Heteroskedastisitas
Saya tahu bahwa OLS tidak bias tetapi tidak efisien di bawah heteroskedastisitas dalam pengaturan regresi linier. Di Wikipedia http://en.wikipedia.org/wiki/Minimum_mean_square_error Estimator MMSE tidak bias asimtotik dan konvergen dalam distribusi ke distribusi normal: , di mana saya (x) adalah informasi Fisher dari x. Dengan demikian, estimator MMSE efisien asimptotik.n−−√(x^−x)→dN(0,I−1(x))n(x^−x)→dN(0,I−1(x))\sqrt{n}(\hat{x} - x) \xrightarrow{d} …

2
Kesimpulan dari output analisis komponen utama
Saya mencoba memahami keluaran dari analisis komponen utama yang dilakukan sebagai berikut: > head(iris) Sepal.Length Sepal.Width Petal.Length Petal.Width Species 1 5.1 3.5 1.4 0.2 setosa 2 4.9 3.0 1.4 0.2 setosa 3 4.7 3.2 1.3 0.2 setosa 4 4.6 3.1 1.5 0.2 setosa 5 5.0 3.6 1.4 0.2 setosa 6 …
9 r  pca  interpretation 

1
LASSO untuk model penjelas: parameter menyusut atau tidak?
Saya sedang melakukan analisis di mana tujuan utamanya adalah untuk memahami data. Dataset cukup besar untuk cross-validation (10k), dan prediktor menyertakan variabel kontinu dan dummy, dan hasilnya kontinu. Tujuan utama adalah untuk melihat apakah masuk akal untuk mengeluarkan beberapa prediktor, agar model lebih mudah diinterpretasikan. Pertanyaan: Pertanyaan saya adalah "vars …

1
Bagaimana cara menghasilkan matriks ortogonal acak yang seragam dari determinan positif?
Saya mungkin punya pertanyaan konyol tentang yang, saya harus akui, saya bingung. Bayangkan berulang-ulang menghasilkan matriks orthogonal acak (ortonormal) terdistribusi seragam beberapa ukuran . Terkadang matriks yang dihasilkan memiliki determinan dan terkadang memiliki determinan . (Hanya ada dua nilai yang mungkin. Dari sudut pandang rotasi ortogonal berarti ada juga satu …

1
Batasan MCMC / EM? MCMC lebih dari EM?
Saat ini saya sedang belajar model Bayesian hierarkis menggunakan JAGS dari R, dan juga pymc menggunakan Python ( "Metode Bayesian untuk Peretas" ). Saya bisa mendapatkan intuisi dari posting ini : "Anda akan berakhir dengan tumpukan angka yang terlihat" seolah-olah "Anda entah bagaimana berhasil mengambil sampel independen dari distribusi rumit …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.