小红书笔记采集学习与测试记录目前针对小红书笔记详情的采集主要测试了三种实现方式第一种Python Web HTML 解析通过 Python 直接获取笔记详情页面再对返回的 Web HTML 进行解析从中提取需要的数据。目前测试发现这种方式在本地环境运行正常可以正常获取并解析所需数据但部署到服务器环境后出现异常虽然获取页面的过程基本正常但 HTML 解析结果与本地存在差异导致部分数据无法正常提取。目前这个问题还在进一步排查中暂时没有找到本地与服务器环境产生差异的具体原因。第二种更换语言及实现方式在 Python 方案之外又重新尝试使用 PHP 进行页面获取和数据解析并调整了具体的解析方式。目前 PHP 版本已经测试成功在本地及服务器环境均可以正常解析出需要的数据。现阶段来看这种方案的稳定性相对较好已经可以正常使用。不过具体为什么 Python 方案在服务器环境下出现差异而 PHP 方案可以正常运行目前原因还需要进一步分析。第三种通过接口直接获取另外测试了直接调用接口获取笔记详情的方案。经过实际测试发现对于部分需要登录状态才能访问的数据接口调用同样需要对应的登录信息。也就是说这类情况下无论是 Web 端还是 App 端均需要具备相应的登录状态才能正常获取数据。当前测试结果目前三种方案的情况如下Python Web HTML 解析本地可用服务器环境存在问题暂未彻底解决。PHP Web HTML 解析目前测试正常服务器端已经可以正常使用。接口直接获取部分数据依赖登录状态Web 端和 App 端均需要对应的登录信息。目前已经有可正常运行的 PHP 方案后续会继续对 Python 方案进行排查同时进一步测试接口方案在不同登录状态下的数据获取情况。