一份典型的中国式 Excel 销售表——标题占两行、多级表头、中间夹着区域小计、尾巴三行合计——用常规的「找对表头+清千分位」方式处理,月度总额可能比真值高出 161%,而且零报错、零警告。这就是为什么需要专业的数据处理 skill。
Huashu-Excel 是一个开源的 Excel/CSV 数据处理与分析 skill,MIT 协议,基于作者在美团做运营时积累的数据处理经验开发。核心设计思路是:在读取原始数据前先做「体检」,保留合并单元格、单元格格式等关键信息,再进行后续分析。

核心工作流程
整体流程包含八个步骤:体检 → 清洗 → 对齐 → 分析 → 对账 → 交付 → 验图 → 质控。实际使用时按需走——查一个数就直接查,要完整报告才全走。
体检:用 openpyxl 读原始单元格
大部分工具的第一步是 pd.read_excel() 直接读入,但读取的那一刻合并单元格、单元格格式、原始类型就全丢了。Huashu-Excel 先用 openpyxl 读取原始单元格做体检,把表头位置、混杂的行、有问题的列全部列出后再开始计算。
对账:利用原表自带合计行做校验
Excel 表中的「合计」行往往是原表作者用公式算出的真值,等于一个免费校验和。该 skill 会拿清洗后的明细自行求和去对表内合计——实测揪出过差额仅 10 元的错误(6,490,430 vs 6,490,420),相对误差肉眼永远发现不了。

质控:独立 Agent 复核
数字对账全通过、退出码全绿,结论仍然可能出错——因为分析窗口是用户自己选的,带有先验偏见。最后一步会另派一个未参与创作的 Agent 从原始数据重算,专门检查时间范围是否被挑选、外部基准分母是否正确等问题。
报告输出格式
支持四种格式:HTML 自包含报告(内联 SVG 图表,微信附件可直接打开)、原生 Excel 图表(改数据图跟着变)、Word 叙述体(Amazon six-pager 风格,不用项目符号),PPT 则由另一个 skill huashu-design 专门处理。

实测:10 份真实业务数据压测
发布前用 10 份真实公开业务数据做压测,每份独立跑全流程。任务不提示任何坑——坑是数据本身就有的。从 106 万行的电商交易明细到 21 万行的纽约市政预算都有。
案例一:纽约市 311 住房工单(159,275 条)
月报口径显示处理时长在涨,看似效率下降。拆解后发现是品类结构变化——处理最快的暖气类工单随供暖季结束大量消失,抬高了整体中位数。同口径再看,13 个品类中 12 个在变快(辛普森悖论的典型案例)。另外 32.4% 的工单以「未能进门」结案,官方口径全算达成,达成率 86.5% 还是 49.5% 取决于选哪个口径。


案例二:106 万行英国电商交易明细



案例三:其他业务数据(财务、人力、宏观等)



开源信息
Huashu-Excel 已在 GitHub 开源,MIT 协议。
项目地址:github.com/alchaincyf/huashu-excel
作者花叔此前从事用户运营工作,每天需要提前两小时取数据、做分析、在早会上同步运营进展。他将这些经验沉淀为 skill,希望帮助被数据折磨的职场人。