sreweekly-digest: 数据目录迁移至 ~/Workspace/nexus/sreweekly/(SKILL.md + 脚本同步)

This commit is contained in:
2026-09-10 20:05:46 +08:00
parent 5ad2a37fb2
commit 3452c0af5f
2 changed files with 5 additions and 5 deletions

View File

@@ -25,7 +25,7 @@ metadata:
## 关键事实 ## 关键事实
- **脚本**:本技能目录 `scripts/sreweekly.py`(绝对路径 `~/.hermes/skills/custom/sreweekly-digest/scripts/sreweekly.py`,软链到 atlas;单文件,依赖 feedparser) - **脚本**:本技能目录 `scripts/sreweekly.py`(绝对路径 `~/.hermes/skills/custom/sreweekly-digest/scripts/sreweekly.py`,软链到 atlas;单文件,依赖 feedparser)
- **数据目录**:`~/Workspace/nexus/Hermes/xingzhi/sreweekly/`(html/ 存每期原始 HTML,markdown/<期号>/ 存每篇一个 md,manifest.json 记状态;README.md 有完整 n8n 配置说明) - **数据目录**:`~/Workspace/nexus/sreweekly/`(html/ 存每期原始 HTML,markdown/<期号>/ 存每篇一个 md,manifest.json 记状态;README.md 有完整 n8n 配置说明)
- **核心发现**:SRE Weekly 的 RSS feed 在 `content:encoded` 字段自带每期完整 HTML(实测最近 5 期全量)——**不用再抓每期页面**,直接从 feed 拿内容 - **核心发现**:SRE Weekly 的 RSS feed 在 `content:encoded` 字段自带每期完整 HTML(实测最近 5 期全量)——**不用再抓每期页面**,直接从 feed 拿内容
## 命令速查 ## 命令速查
@@ -38,7 +38,7 @@ python3 $S --check # 输出 NEW:533,532 或 NONE(供 n8n 分支)
python3 $S --extract pending # 提取所有未处理期(n8n 每日流程推荐) python3 $S --extract pending # 提取所有未处理期(n8n 每日流程推荐)
python3 $S --extract 533 # 指定期 / latest / all(已提取的需 --force 覆盖) python3 $S --extract 533 # 指定期 / latest / all(已提取的需 --force 覆盖)
python3 $S --status # 状态表(期号/日期/HTML/提取/文章数) python3 $S --status # 状态表(期号/日期/HTML/提取/文章数)
# 可选: --feed URL / --dir PATH / --force(数据目录默认 ~/Workspace/nexus/Hermes/xingzhi/sreweekly/) # 可选: --feed URL / --dir PATH / --force(数据目录默认 ~/Workspace/nexus/sreweekly/)
``` ```
- 所有命令**幂等**:重复扫描不重复入库,重复提取自动跳过已提取的期 - 所有命令**幂等**:重复扫描不重复入库,重复提取自动跳过已提取的期

View File

@@ -8,7 +8,7 @@ SRE Weekly 抓取与文章提取脚本
设计给 n8n 定时任务调用,通过不同参数驱动,脚本自身不发送邮件。 设计给 n8n 定时任务调用,通过不同参数驱动,脚本自身不发送邮件。
目录结构(默认工作目录 ~/Workspace/nexus/Hermes/xingzhi/sreweekly/): 目录结构(默认工作目录 ~/Workspace/nexus/sreweekly/):
sreweekly/ sreweekly/
├── manifest.json # 状态记录(每期: html 是否保存、文章是否提取、文章数) ├── manifest.json # 状态记录(每期: html 是否保存、文章是否提取、文章数)
├── html/<id>-<日期>.html # 每期原始 HTML(feed 的 content:encoded 原样保存) ├── html/<id>-<日期>.html # 每期原始 HTML(feed 的 content:encoded 原样保存)
@@ -28,7 +28,7 @@ SRE Weekly 抓取与文章提取脚本
选项: 选项:
--feed URL RSS 地址(默认 https://sreweekly.com/feed/) --feed URL RSS 地址(默认 https://sreweekly.com/feed/)
--dir PATH 工作目录(默认 ~/Workspace/nexus/Hermes/xingzhi/sreweekly/) --dir PATH 工作目录(默认 ~/Workspace/nexus/sreweekly/)
--force 重新提取已提取过的期(覆盖旧文件) --force 重新提取已提取过的期(覆盖旧文件)
""" """
from html.parser import HTMLParser from html.parser import HTMLParser
@@ -40,7 +40,7 @@ except ImportError:
sys.exit("缺少依赖: 请先执行 pip3 install feedparser") sys.exit("缺少依赖: 请先执行 pip3 install feedparser")
DEFAULT_FEED = "https://sreweekly.com/feed/" DEFAULT_FEED = "https://sreweekly.com/feed/"
DEFAULT_DIR = os.path.expanduser("~/Workspace/nexus/Hermes/xingzhi/sreweekly") DEFAULT_DIR = os.path.expanduser("~/Workspace/nexus/sreweekly")
# ---------------------------------------------------------------- manifest # ---------------------------------------------------------------- manifest