Các lượt nộp
    Danh sách bài
    Trang chủ
    Báo lỗi

    solution

    Đề bài: [Data Science] Information gain của một thuộc tính

    Cho nnn mẫu, mỗi mẫu có giá trị thuộc tính rời rạc xix_ixi​ và nhãn lớp yiy_iyi​. Information Gain khi chia theo thuộc tính xxx:

    IG=H(y)−∑v∣Sv∣n H(Sv)IG = H(y) - \sum_{v}\frac{|S_v|}{n}\,H(S_v)IG=H(y)−∑v​n∣Sv​∣​H(Sv​)

    trong đó SvS_vSv​ là tập các nhãn của những mẫu có x=vx=vx=v, và HHH là entropy (−∑cpclog⁡2pc-\sum_c p_c\log_2 p_c−∑c​pc​log2​pc​, quy ước 0log⁡20=00\log_2 0=00log2​0=0). Hãy in IGIGIG.

    • Định dạng đầu vào:

      Dòng đầu: nnn. nnn dòng tiếp theo, mỗi dòng hai số nguyên xix_ixi​ yiy_iyi​.

    • Ràng buộc đầu vào:

      1≤n≤10001 \le n \le 10001≤n≤1000; xi,yix_i, y_ixi​,yi​ là số nguyên không âm.

    • Định dạng đầu ra:

      Một số thực: information gain, làm tròn 2 chữ số thập phân.

    Ví dụ:

    Đầu vào:

    4
    0 0
    0 0
    1 1
    1 1

    Đầu ra:

    1.00

    Giải thích:

    H(y)=1 (2 lớp cân bằng). Nhóm x=0 → nhãn {0,0} H=0; nhóm x=1 → {1,1} H=0. IG = 1 − (2/4·0 + 2/4·0) = 1.00

    Đang tải editor...