数据科学家必备3个Claude技能
现在的孩子们不知道那是什么感觉。
我过去常常花几个小时:
- 从零开始逐行编写Python和SQL代码
- 记住要导入哪些库以及它们包含哪些函数(from sklearn.metrics import r2_score)
- 调试代码错误
- 为我的代码编写文档
- 构建仪表板来分析大型数据集
即使在去年,随着AI工具变得越来越先进,我作为数据科学家的工作也发生了变化。我不再是一个编码机器,而更像一个策略师。一个真正了解我组织中的数据并知道如何最好地展示它并从中获取洞察力的人。
Claude正在以更快的速度改变一切。
Claude是那种我相信会比任何人想象的更快地改变这个行业和这个职业的工具。我不会撒谎,这有点可怕。同时,数据科学家可以通过一些方式来掌握这个工具,精通它,并继续保持领先优势。
以下是每个数据科学家现在都应该努力掌握的3个关键技能:
1. Claude仪表板
我过去常常花一整天时间为客户端构建一个Tableau仪表板,只是为了探索一些关于大型数据集的问题,这些问题可能在几个月后就再也不会被查看了。
现在,Claude可以在几分钟内生成一个完全工作、交互式的仪表板,包括:
- KPI指标卡
- 折线图
- 条形图
- 下钻按钮
- 选项卡
- ……以及更多
让我们展示一个使用AEP每小时能源数据集(CC0许可证)的简单示例。
Claude提示:
我有一个包含每小时能源消耗(AEP_MW)的时间序列数据集,带有一个日期时间列。为我构建一个交互式HTML仪表板,包括:
- 四个KPI卡,显示平均负载、峰值负载、最小负载以及夏季与冬季的比较
- 一个折线图,显示按工作日与周末划分的每日平均负载
- 一个条形图,显示平均月度负载,较高月份用较暖的颜色突出显示
- 一个条形图,显示按星期几划分的平均负载,周末用不同颜色。使用干净、简洁的样式。
结果如下:
从仪表板中立即显现出一些洞察力,这些洞察力无法从原始CSV中获得:
- 工作日消耗在下午5-6点左右急剧达到峰值,而周末峰值更早(下午2点左右),整体水平更低
- 7月和8月的消耗明显高于春季月份,确认了来自空调负载的强烈夏季季节性
- 星期六和星期日的负载始终比工作日低约10%
这类仪表板非常适合进行EDA,也适合为只想在单个时间点了解情况的利益相关者生成一次性报告。你也可以按计划生成仪表板,以便每周获得新报告。
2. Claude Cowork用于优先处理Jira工单和任务
这是我过去典型周一早上的样子:打开Jira,点击20个未完成的工单,试图记住每个工单的上下文,弄清楚什么阻碍了什么,并写出一周的粗略优先级列表。
Claude Cowork与Claude Chat不同,因为它实际上连接到你的桌面,可以读取/写入文件。它可以连接到Jira(或其他Scrum/敏捷平台),并总结你一周的优先事项。以下是一个示例:
从当前冲刺中提取我所有未完成的工单。对于每个工单,给我:工单ID、需要发生什么的一句话摘要、当前状态以及任何阻碍。按优先级排序,并告诉我今天应该先处理什么。
以下是你可以与Cowork一起使用的其他一些提示:
向Jira写工单
这是我今天模型评审会议的笔记:[粘贴笔记——或者如果你的Cowork连接到Google Drive,则链接到笔记]。为DS项目中的每个操作项创建Jira工单。对于每个工单,写一个清晰的标题,一个2句话的描述,说明需要发生什么以及为什么,根据紧急程度设置优先级,并将它们分配给当前冲刺。
准备利益相关者会议
阅读过去3周标记为'model-deployment'的工单评论,并为我写一个5要点的状态摘要,我可以与工程团队负责人分享。保持非技术性。
从头开始起草文档
打开我项目文件夹中的preprocessing_pipeline.py文件,并编写一个README部分,解释管道做什么、它期望什么输入以及它输出什么。
冲刺结束报告
根据本次冲刺的已关闭工单,为我的经理写一个3段冲刺摘要,涵盖我们交付了什么、学到了什么以及什么延续到下一次冲刺。
这是一个巨大的时间节省者,也会让你更有条理。
3. 使用Claude Code调试
Claude Code是一个命令行工具,在你的终端中运行,可以完全访问你的代码库。它可以:
- 跨项目读取文件
- 运行命令
- 执行测试
- 跨多个文件进行更改
对于数据科学家来说,最直接有用的应用是调试管道。
这是我最近在工作中遇到的一个真实场景,使用dbt。模型和文件的名称已被更改,因此我不分享任何机密公司信息。
我运行了dbt run --select fct_energy_forecast,得到了这个:Database Error in model fct_energy_forecast column "meter_reading_mw" does not exist LINE 14: AVG(meter_reading_mw) AS avg_load_mw,
dbt模型的问题在于下游mart模型中的列错误不会告诉你哪里的列实际上断了。它可能在原始源中、在staging模型中、在中间聚合层中或在mart本身中被重命名。
要手动找到根本原因,你必须逐个打开依赖链中的每个文件,跟踪列名称通过每个转换,并找出旧名称从未更新的位置。在一个有24个模型和6个源的项目中,这可能需要超过一个小时的阅读、重新运行和重新构建模型。
我将其交给了Claude Code:
我的dbt模型fct_energy_forecast失败了,显示'column meter_reading_mw does not exist'。找到此列在上游定义的位置,跟踪所有依赖模型和源文件,弄清楚发生了什么,并修复它。
Claude读取了依赖链中的每个文件,大约40秒后返回了诊断结果。
然后它应用了修复,重新运行了模型,并确认它通过了。
4、结束语
随着工具的发展,我们的角色也会改变。Claude正在改变数据科学家最终将要做的工作类型。我们不再每天花8个小时调试各种dbt和Python错误,这些错误将在2分钟内解决,让我们有更多时间深入研究数据并提出更重要的问题。作为2026年的数据科学家,我们不断增长技能并保持最新状态非常重要。
同样重要的是要注意,虽然Claude有很多功能, 它仍然是AI,可以(并且确实)犯错误。掌握Claude的数据科学家仍然需要验证数据、改进提示和流程,并在Claude错误时纠正它。
原文链接: 3 Claude Skills Every Data Scientist Needs in 2026
汇智网翻译整理,转载请标明出处