Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Interval kepercayaan kembali ditransformasikan
Setelah menemukan diskusi ini, saya mengajukan pertanyaan tentang konvensi interval kepercayaan yang ditransformasikan kembali. Menurut artikel ini , cakupan nominal back-transformed CI untuk rata-rata variabel acak log-normal adalah: LCL(X)=exp(Y+var(Y) UCL ( X) = exp( Y+ var ( Y)2+ zvar ( Y)n+ var ( Y)22 ( n - 1 )------------√) UCL(X)=exp⁡(Y+var(Y)2+zvar(Y)n+var(Y)22(n−1))\ …


2
Signifikansi koefisien korelasi rata-rata
Penafian: jika Anda menemukan pertanyaan ini terlalu mirip dengan yang lain, saya senang bisa digabung. Namun, saya tidak menemukan jawaban yang memuaskan di tempat lain (dan belum memiliki "reputasi" untuk berkomentar atau mendukung), jadi saya pikir akan lebih baik untuk mengajukan pertanyaan baru sendiri. Pertanyaan saya adalah ini. Untuk masing-masing …

3
Kapan kotak paling tidak akan menjadi ide yang buruk?
Jika saya memiliki model regresi: mana dan ,Y=Xβ+εY=Xβ+ε Y = X\beta + \varepsilon V[ε]=Id∈Rn×nV[ε]=Id∈Rn×n\mathbb{V}[\varepsilon] = Id \in \mathcal{R} ^{n \times n}E[ε]=(0,…,0)E[ε]=(0,…,0)\mathbb{E}[\varepsilon]=(0, \ldots , 0) kapan akan menggunakan , estimator kuadrat terkecil biasa dari , menjadi pilihan yang buruk untuk estimator?βOLSβOLS\beta_{\text{OLS}}ββ\beta Saya mencoba mencari tahu contoh kuadrat paling tidak berfungsi dengan …

1
Apakah SurveyMonkey mengabaikan fakta bahwa Anda mendapatkan sampel non-acak?
SurveyMonkey memiliki langkah-langkah dan bagan untuk Anda mengetahui ukuran sampel apa yang Anda butuhkan untuk margin kesalahan atau interval kepercayaan tertentu, berdasarkan pada ukuran populasi Anda. Ukuran sampel SurveyMonkey Apakah bagan ini mengabaikan fakta bahwa Anda tidak akan mendapatkan sampel acak, karena Anda hanya membuat orang-orang yang repot-repot menanggapi survei? …


3
Komponen utama pertama tidak memisahkan kelas, tetapi PC lain melakukannya; bagaimana mungkin?
Saya menjalankan PCA pada 17 variabel kuantitatif untuk mendapatkan serangkaian variabel yang lebih kecil, yaitu komponen utama, yang akan digunakan dalam pembelajaran mesin yang diawasi untuk mengklasifikasikan instance ke dalam dua kelas. Setelah PCA, PC1 menyumbang 31% dari varians dalam data, PC2 menyumbang 17%, PC3 menyumbang 10%, PC4 menyumbang 8%, …

4
Analisis Komponen Utama dan Regresi dengan Python
Saya mencoba mencari cara untuk mereproduksi di Python beberapa pekerjaan yang telah saya lakukan di SAS. Menggunakan dataset ini , di mana multicollinearity adalah masalah, saya ingin melakukan analisis komponen utama dalam Python. Saya telah melihat scikit-learn dan statsmodels, tapi saya tidak yakin bagaimana mengambil output mereka dan mengubahnya menjadi …

3
Jarak mana yang digunakan? mis. manhattan, euclidean, Bray-Curtis, dll
Saya bukan seorang ahli ekologi komunitas, tetapi hari ini saya sedang mengerjakan data ekologi komunitas. Apa yang saya tidak bisa mengerti, terlepas dari matematika dari jarak ini, adalah kriteria untuk setiap jarak yang digunakan dan dalam situasi apa itu dapat diterapkan. Misalnya, apa yang harus digunakan dengan data hitungan? Bagaimana …

1
Tetapkan bobot untuk variabel dalam analisis kluster
Saya ingin menetapkan bobot yang berbeda untuk variabel dalam analisis kluster saya, tetapi program saya (Stata) tampaknya tidak memiliki opsi untuk ini, jadi saya harus melakukannya secara manual. Bayangkan 4 variabel A, B, C, D. Bobot untuk variabel-variabel tersebut seharusnya w(A)=50% w(B)=25% w(C)=10% w(D)=15% Saya bertanya-tanya apakah salah satu dari …
11 clustering  stata 


1
Pelatihan jaringan saraf konvolusi
Saat ini saya sedang mengerjakan perangkat lunak pengenal wajah yang menggunakan jaringan saraf konvolusi untuk mengenali wajah. Berdasarkan bacaan saya, saya telah mengumpulkan bahwa jaringan saraf convolutional telah berbagi bobot, sehingga menghemat waktu selama pelatihan. Tapi, bagaimana cara mengadaptasi backpropagation sehingga dapat digunakan dalam jaringan saraf konvolusi. Dalam backpropagation, seseorang …


4
Klasifikasi untuk label kelas yang tidak pasti
Katakanlah saya memiliki serangkaian instance dengan label kelas yang terkait. Tidak masalah bagaimana label ini diberi label, tetapi seberapa yakin keanggotaan kelas mereka. Setiap instanc milik tepat satu kelas. Katakanlah saya dapat mengukur kepastian setiap keanggotaan kelas dengan atribut nominal yang berubah dari 1 menjadi 3 (sangat pasti menjadi tidak …

3
Jarak antara dua campuran Gaussian untuk mengevaluasi solusi cluster
Saya sedang menjalankan simulasi cepat untuk membandingkan metode pengelompokan yang berbeda, dan saat ini mengalami kesulitan mencoba untuk mengevaluasi solusi cluster. Saya tahu berbagai metrik validasi (banyak ditemukan di cluster.stats () di R), tetapi saya menganggap itu paling baik digunakan jika perkiraan jumlah cluster sebenarnya sama dengan jumlah sebenarnya dari …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.