Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Termasuk Ketentuan Interaksi di Hutan Acak
Misalkan kita memiliki respons Y dan prediktor X1, ...., Xn. Jika kita mencoba mencocokkan Y melalui model linier X1, ...., Xn, dan kebetulan saja bahwa hubungan yang benar antara Y dan X1, ..., Xn tidak linier, kita mungkin dapat untuk memperbaiki model dengan mengubah X entah bagaimana dan kemudian menyesuaikan …

3
Metrik untuk mengevaluasi algoritma peringkat
Saya tertarik melihat beberapa metrik yang berbeda untuk algoritme pemeringkatan - ada beberapa yang terdaftar di halaman wikipedia Learning to Rank, termasuk: • Rata-rata presisi rata-rata (MAP); • DCG dan NDCG; • Precision @ n, NDCG @ n, di mana "@n" menunjukkan bahwa metrik dievaluasi hanya pada n dokumen teratas; …

1
Apa itu "Harapan Kemungkinan Maksimum yang Ditargetkan"?
Saya mencoba memahami beberapa makalah oleh Mark van der Laan. Dia seorang ahli statistik teoritis di Berkeley yang mengerjakan masalah yang tumpang tindih secara signifikan dengan pembelajaran mesin. Satu masalah bagi saya (selain matematika yang mendalam) adalah bahwa ia sering akhirnya menggambarkan pendekatan pembelajaran mesin yang akrab dengan menggunakan terminologi …

2
Apa definisi akurasi Top-n?
Saya membaca makalah ilmiah tentang klasifikasi gambar. Dalam hasil percobaan mereka berbicara tentang akurasi top-1 dan top-5 tetapi saya belum pernah mendengar istilah itu, juga tidak dapat menemukannya menggunakan google. Bisakah seseorang memberi saya definisi atau menunjuk saya ke suatu tempat? :)

1
Bagaimana menafsirkan ACF negatif (fungsi autokorelasi)?
Jadi saya merencanakan ACF / PACF dari pengembalian minyak dan mengharapkan untuk melihat beberapa autokorelasi positif tetapi yang mengejutkan saya, saya hanya mendapatkan autokorelasi signifikan negatif. Bagaimana saya menafsirkan grafik di atas? Mereka tampaknya menunjukkan bahwa ada kecenderungan pengembalian minyak meningkat ketika sebelumnya menurun dan sebaliknya, sehingga perilaku berosilasi. Harap …



3
Perbandingan daftar peringkat
Misalkan dua kelompok, terdiri dari dan masing-masing peringkat satu set 25 item dari yang paling penting sampai yang paling tidak penting. Apa cara terbaik untuk membandingkan peringkat ini?n1n1n_1n2n2n_2 Jelas, dimungkinkan untuk melakukan 25 tes Mann-Whitney U, tetapi ini akan menghasilkan 25 hasil tes untuk ditafsirkan, yang mungkin terlalu banyak (dan, …

1
Korelasi jarak versus informasi timbal balik
Saya telah bekerja dengan informasi timbal balik untuk beberapa waktu. Tetapi saya menemukan ukuran yang sangat baru dalam "dunia korelasi" yang juga dapat digunakan untuk mengukur independensi distribusi, yang disebut "korelasi jarak" (juga disebut korelasi Brown): http://en.wikipedia.org/wiki/Brownian_covariance . Saya memeriksa makalah tempat langkah ini diperkenalkan, tetapi tanpa menemukan kiasan untuk …


1
Apa batas ekor paling tajam yang diketahui untuk
Misalkan menjadi variabel acak terdistribusi chi-kuadrat dengan derajat kebebasan k . Apa batas paling tajam yang diketahui untuk probabilitas berikutX∼χ2kX∼χk2X \sim \chi^2_kkkk P[X&gt;t]≤1−δ1(t,k)P[X&gt;t]≤1−δ1(t,k) \mathbb{P}[X > t] \leq 1 - \delta_1(t, k) dan P[X&lt;z]≤1−δ2(z,k)P[X&lt;z]≤1−δ2(z,k) \mathbb{P}[X < z] \leq 1 - \delta_2(z, k) di mana dan δ 2 adalah beberapa fungsi. Pointer …




2
Mengapa Anda perlu skala data di KNN
Bisakah seseorang tolong jelaskan kepada saya mengapa Anda perlu menormalkan data saat menggunakan K tetangga terdekat. Saya sudah mencoba mencari ini, tetapi saya masih belum bisa memahaminya. Saya menemukan tautan berikut: https://discuss.analyticsvidhya.com/t/why-it-is-n perlu-to-normalisasi-in-knn/2715 Namun dalam penjelasan ini, saya tidak mengerti mengapa kisaran yang lebih besar di salah satu fitur mempengaruhi …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.