优化文档采集工具
- 输出文件名添加 YYMMDD_ 日期前缀,便于按时间排序 - 改用 storageState 完整保存登录态(cookies + localStorage),大幅减少重复扫码 - 增加 TOKEN 轮询宽限期,避免 SPA 异步加载时误判未登录 - 更新 README 文档记录
This commit is contained in:
@@ -126,3 +126,24 @@ node auto-scrape.mjs <url>
|
||||
**Q: 图片下载失败?**
|
||||
|
||||
飞书图片需要有效的个人授权。确认 `lark-cli auth status` 显示已登录,且包含 `docs:document.media:download` 权限。
|
||||
|
||||
---
|
||||
|
||||
## 更新记录
|
||||
|
||||
### 2024-09-13
|
||||
|
||||
**文件名优化**
|
||||
- 自动生成的 Markdown 文件名现在带有 `YYMMDD_` 日期前缀
|
||||
- 输出示例:`output/260913_《战略笃定》探索营1.md`
|
||||
- 便于按采集时间排序,同一文档的多次采集版本可区分
|
||||
|
||||
**登录态持久化优化(大幅减少重复扫码)**
|
||||
- 改用 Playwright `storageState` 完整保存登录态(cookies + localStorage)
|
||||
- 修复了原先只存 cookie 导致每次都要重新扫码的问题(一堂平台的 API 鉴权 TOKEN 存在 localStorage 中)
|
||||
- 首次登录后,后续运行基本无需再扫码,直到服务端会话过期(通常数天)
|
||||
- `cookies.json` 从旧格式自动升级为新格式(兼容已有文件)
|
||||
|
||||
**登录判定改进**
|
||||
- 增加 5 秒轮询宽限期,避免 SPA 异步写入 TOKEN 时误判为未登录
|
||||
- 减少因页面加载时序导致的不必要登录提示
|
||||
|
||||
Reference in New Issue
Block a user