本文介绍如何准确统计字典中所有值列表(如 ['x', 'y'])的标准化组合(排序后去重)及其出现次数,并按频次降序输出形如 n=5: ('x', 'y') 的结果,避免因字典键重复导致的覆盖问题。

在数据处理中,常会遇到这样的需求:统计字典中每个值列表的唯一组合及其出现频次。比如,给定字典 {'HH1': ['x'], 'HH2': ['y', 'x'], ...},目标是得到每个标准化组合(如 ('x', 'y'))出现的次数,并按频次降序输出。下面就来详细拆解正确做法。

如何统计字典中值列表的唯一组合及其出现频次

核心目标直截了当:将每个值列表标准化为有序元组(例如 ['y', 'x']('x', 'y')),然后统计每种标准化组合在整个字典中间出现的精确次数。但实际操作中,不少人容易掉进这几个坑里:

✅ 正确解法的关键在于:以标准化元组为字典键,频次为值。下面是推荐实现,简洁、高效且语义清晰:

from collections import defaultdict

HH_dict = {
    'HH1': ['x'], 'HH2': ['y', 'x'], 'HH3': ['x', 'z'], 'HH4': ['x'], 'HH5': ['x'],
    'HH6': ['x'], 'HH7': ['x'], 'HH8': ['x', 'y', 'z'], 'HH9': ['x'], 'HH10': ['x', 'y'],
    'HH11': ['x'], 'HH12': ['x'], 'HH13': ['x'], 'HH14': ['x'], 'HH15': ['x', 'y'],
    'HH16': ['x', 'y'], 'HH17': ['x', 'y'], 'HH18': ['x']
}

# 步骤1:统计每种标准化组合(排序后转tuple)的出现次数
combination_count = defaultdict(int)
for lst in HH_dict.values():
    # 标准化:去重 + 排序 + 转元组(确保 ['y','x'] 和 ['x','y'] 视为同一组合)
    key = tuple(sorted(set(lst)))
    combination_count[key] += 1

# 步骤2:按频次降序输出(频次相同时可选按元组字典序升序,增强可读性)
for combo, count in sorted(combination_count.items(), key=lambda x: (-x[1], x[0])):
    print(f"n={count}: {combo}")

输出结果:

n=11: ('x',)
n=5: ('x', 'y')
n=1: ('x', 'z')
n=1: ('x', 'y', 'z')

? 关键说明:

⚠️ 注意事项:

该方法时间复杂度为 O(N×M log M),其中 N 为字典长度,M 为单个列表平均长度,兼顾效率与可维护性,适用于中等规模数据场景。

本文转载于:https://www.php.cn/faq/2345546.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。