CrewAI工具调用钩子实战:从黑盒到可控的Agent开发
2026/10/3 14:18:27
摘要:本文针对科研人员在文献计量分析中面临的关键词清洗难题,详细解析如何利用CiteSpace工具进行高效关键词清洗。通过实战案例演示关键词去重、标准化和语义合并等操作,帮助读者提升文献分析质量,避免因关键词混乱导致的统计偏差。文章包含完整操作步骤和避坑指南,适合需要进行大规模文献分析的科研工作者。
做文献计量最崩溃的瞬间,往往不是跑不出图,而是跑出来的图自己都不信:
这些“脏数据”会让共现网络出现伪热点、伪桥接,后续的战略坐标、突现检测全都跑偏。一句话:关键词不洗干净,结论就站不住。
| 工具 | 清洗功能 | 易用性 | 可视化 | 备注 |
|---|---|---|---|---|
| VOSviewer | 支持同义词合并 | ★★★☆☆ | ★★★★★ | 需手动建同义词表,无批量脚本 |
| Bibliometrix(R) | 支持正则+字典 | ★★☆☆☆ | ★★★☆☆ | 语法门槛高,适合R用户 |
| CiteSpace | 支持批量清洗+去重+合并 | ★★★★☆ | ★★★★☆ | 内置“Data Cleaning”模块,GUI操作 |
结论:CiteSpace在“GUI友好+可脚本化+可视化闭环”三点上取得平衡,对非编程背景的科研人员最友好。
download_xxx.txt,放在同一文件夹CleanDemoData → Import/Export → Remove Duplicatesdownload_xxx_dedup.txtData → Import/Export → Normalize Keywordsmydict.txt,每行一条,格式COVID-19=Covid-19thesaurus.txt,放在CiteSpace\data\thesaurus\目录machine learning,ML,Machine Learning artificial intelligence,AI,Artificial Intelligence下面用一份真实WOS数据集(COVID-19主题,1990-2023,共18 732条记录)演示完整流程。
download_covid.txt放入data\covid\Data → Remove Duplicatesdownload_covid_dedup.txt,记录减至17 405条covid_dict.txt:COVID-19=COVID-19 SARS-CoV-2=SARS-CoV-2 coronavirus=Coronavirusdownload_covid_norm.txtthesaurus_covid.txt:COVID-19,COVID19,covid-19 Machine Learning,ML Public Health,Public health,public-healthCiteSpace.ini,-Xmx改为物理内存的70%,8 G以上数据建议16 G。Preferences → Visualization取消“Real-time layout”,后台跑得快。# 提前筛词,保留频次≥3的关键词 import pandas as pd df = pd.read_csv('keywords_raw.csv') df = df[df['freq'] >= 3] df.to_csv('keywords_clean.csv', index=False)data\project\cache\*。关键词清洗是文献计量里“脏活累活”,却直接决定后续分析可信度。CiteSpace把最常用的“去重-标准化-合并”集成在GUI里,对非编程用户足够友好;再配合简单的Python预处理,即可在半小时内完成过去需要手工几天的工作量。
思考题(欢迎评论区交作业):
把答案做成流程图或脚本分享出来,我们一起把“清洗”卷到飞起。