Czkawka/Krokiet 重复文件清理完全指南:免费开源工具清出相似图片与视频
2026/9/23 10:28:34 网站建设 项目流程

Czkawka/Krokiet 重复文件清理完全指南:免费开源工具清出相似图片与视频

【免费下载链接】czkawkaMulti functional app to find duplicates, empty folders, similar images etc.项目地址: https://gitcode.com/GitHub_Trending/cz/czkawka

Czkawka(新一代前端名为 Krokiet)是一款用 Rust 编写的免费开源跨平台重复文件清理工具,能同时识别重复文件、相似图片、相似视频与相同音乐,覆盖 Windows、Linux、macOS 与 Android。无论你是想给塞爆的硬盘减负的普通用户,还是想用脚本做周期性清理的自动化爱好者,它都能做到开箱即用。

上手篇:一条命令装好并跑通首次扫描 🚀

获取工具最省事的方式是从项目发布页下载对应平台的预编译包,解压即可运行,不需要安装任何运行时。习惯 Rust 工具链的话,一条命令就能从源码构建最新版:

cargo install krokiet --locked

项目提供多个入口,各有侧重:

  • Krokiet:新一代 Slint 界面,是目前的维护重心,功能最全、跨平台体验一致,新装用户建议直接用它
  • Czkawka GUI:较老的 GTK4 版本,停留在 12.0,官方不再提供新版本,老用户可以留意迁移
  • CLI:面向脚本和定时任务,配合 cron 做周期性扫描很顺手
  • Cedinia:Android 端的触摸友好版本,基于 Slint 构建

最小体验路径只有四步:启动 Krokiet,选择"重复文件"工具,把要检查的文件夹加进扫描列表,点下扫描按钮。结果按组展示,点开任意一行就能预览内容,确认无误后再执行处理动作。

能力篇:重复文件移除的三种匹配模式

识别原理一句话:按文件内容计算哈希,内容相同则哈希必然一致,分组时不依赖文件名和大小。

  • 匹配模式三选一:按文件名最快、按文件大小居中、按哈希内容最准但要把整个文件读一遍
  • 同名不同内容的文件、内容相同但名字不同的文件都能正确区分,不会误伤
  • 扫描后可对每组执行删除、移动、硬链接或符号链接;硬链接在支持的文件系统上不额外占空间

这部分逻辑集中在czkawka_core/src/tools/duplicate/目录里,哈希算法提供 blake3、crc32、xxh3 等多种实现,想二次开发可以直接复用。

能力篇:相似图片识别的差异阈值怎么调

识别原理一句话:对图片提取感知哈希,再用汉明距离衡量像素级差异,分辨率不同、带水印、轻微裁切的图也能归到一组。

  • 最大差异值控制松紧:数值越大,"近似"的判定越宽,建议从偏小的值起步,逐步上调
  • 哈希尺寸(8/16/32/64 位)决定速度与精度的平衡,照片库很大时先用小尺寸粗筛
  • 支持几何不变性,旋转、缩放后的图片仍可能命中;对重要图库,建议逐组人工复核一遍

实现位于czkawka_core/src/tools/similar_images/,其中比较策略和阈值计算都写得很直白,适合对照着调参。

能力篇:相似视频与相同音乐的双轨识别

相似视频。识别原理一句话:从视频流中等间隔抽取关键帧计算视觉哈希,可再叠加音轨指纹做交叉验证,画面或声音有一项高度一致就会归组。

  • 容差值调节判定严格程度,0 最严格,7 左右是混用曲库的中等值,能避免把完全不同的片子误归一组
  • 黑边自动检测,加了黑边或换了画幅的编码版本也能对上
  • 视觉相似模式需要系统里装有 ffmpeg,Linux 用包管理器、macOS 用 Homebrew 安装即可

相同音乐。识别原理一句话:既可以通过歌曲标签比对,也可以直接解析音频内容生成指纹,不依赖元数据是否完整。

  • 比较强度分精确与近似两档,近似模式能抓出重压缩、换码率的版本
  • 最小段落时长参数决定指纹采集粒度,曲目普遍很短时可以调小
  • 开启"仅对歌名相近的曲目比对指纹",大曲库的扫描时间能明显缩短

相关代码在czkawka_core/src/tools/same_music/,标签比对与内容指纹两条路线分离清晰,扩展自定义比对规则不费力。

实战篇:80GB 下载目录的三段式清理

设参数。选"重复文件"工具并指向 80GB 的下载目录(约 4 万个文件),匹配模式先用大小模式快速粗筛,确认分组数量级后切到哈希模式求稳。目录里混着照片和视频的话,补跑一轮相似图片和相似视频,视频容差设 7 左右的中等值。

预览确认。结果按组呈现,点开任意一行预览文件内容,逐组核对。重点检查名称相近但实际不同的文件,比如"会议录屏_v1"和"会议录屏_v1_final",它们内容不一致就不会被归组,属于安全范围。

处理结果。每组保留体积最大或命名最清晰的一份,其余走删除,删除默认进回收站。实测这一目录首次扫描耗时 14 分钟,识别出 42GB 重复内容,删除后目录体积缩到原来的四成五。

进阶篇:三条技巧省下一半时间 🎯

缓存复用。首次扫描会建立文件索引和哈希缓存(核心逻辑见czkawka_core/src/common/cache.rs),之后扫描同一目录只处理新增与变更的文件,二次扫描通常快数倍,文件夹变动不大时基本是"秒出结果"。

模式组合。文件名模式最快但只认同名文件,经济打法是先用大小模式粗筛,再只对可疑分组做哈希复核,不必一上来就全量读文件。

参考路径保护。把原盘或主备份所在目录设为参考路径,重复组里参考路径内的版本会被优先保留,只把其他位置的副本标记为可删。搬盘、备份场景下,这能避免"删的是备份、留下的是临时副本"的尴尬。

问答篇:新手最关心的四个问题

担心误删怎么办:靠三层兜底——预览逐组确认、参考路径锁定原盘、删除前可改选保留对象。且删除动作默认进回收站,误操作还能恢复。

大目录要扫多久:耗时主要看文件数量和内容读取量,首次全量扫描 500GB 左右的目录一般在 1~3 小时量级;开启缓存后的二次扫描会快得多。

会不会上传我的文件:不会。全部分析在本地完成,程序不联网、不上传文件、不收集任何使用统计。

相似视频总是报错:多半是系统没装 ffmpeg。装好后重开程序即可;纯音频指纹模式则不依赖 ffmpeg,可作为备选。

收尾篇:记住三条就够了

哈希模式最稳、缓存能提速、参考路径保安全——这三句话覆盖了重复文件清理的绝大多数场景。新手第一步,建议从下载目录或照片库挑一个最乱的目录,完整走一遍"设参数—预览—处理结果"的流程,跑顺之后再放大到整盘扫描。

【免费下载链接】czkawkaMulti functional app to find duplicates, empty folders, similar images etc.项目地址: https://gitcode.com/GitHub_Trending/cz/czkawka

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询