category-statistics
Installation
SKILL.md
Skill Steps
Step1 提取目标类别数据,清洗无效标签,并统计各类别数量与占比。
import pandas as pd
def calculate_distribution(data, target_col='类别'):
# 检查目标列是否存在
if target_col not in data.columns:
raise ValueError(f'未找到指定的类别字段: {target_col}')
# 提取数据,清洗无效标签(如'--'、'代码'等占位符)
category_data = data[target_col].dropna().replace(['--', '代码'], pd.NA).dropna()
# 统计各类别数量并计算占比
counts = category_data.value_counts()
proportions = (counts / counts.sum()) * 100