sreweekly-digest: 数据目录迁移至 ~/Workspace/nexus/sreweekly/(SKILL.md + 脚本同步)
This commit is contained in:
@@ -25,7 +25,7 @@ metadata:
|
|||||||
## 关键事实
|
## 关键事实
|
||||||
|
|
||||||
- **脚本**:本技能目录 `scripts/sreweekly.py`(绝对路径 `~/.hermes/skills/custom/sreweekly-digest/scripts/sreweekly.py`,软链到 atlas;单文件,依赖 feedparser)
|
- **脚本**:本技能目录 `scripts/sreweekly.py`(绝对路径 `~/.hermes/skills/custom/sreweekly-digest/scripts/sreweekly.py`,软链到 atlas;单文件,依赖 feedparser)
|
||||||
- **数据目录**:`~/Workspace/nexus/Hermes/xingzhi/sreweekly/`(html/ 存每期原始 HTML,markdown/<期号>/ 存每篇一个 md,manifest.json 记状态;README.md 有完整 n8n 配置说明)
|
- **数据目录**:`~/Workspace/nexus/sreweekly/`(html/ 存每期原始 HTML,markdown/<期号>/ 存每篇一个 md,manifest.json 记状态;README.md 有完整 n8n 配置说明)
|
||||||
- **核心发现**:SRE Weekly 的 RSS feed 在 `content:encoded` 字段自带每期完整 HTML(实测最近 5 期全量)——**不用再抓每期页面**,直接从 feed 拿内容
|
- **核心发现**:SRE Weekly 的 RSS feed 在 `content:encoded` 字段自带每期完整 HTML(实测最近 5 期全量)——**不用再抓每期页面**,直接从 feed 拿内容
|
||||||
|
|
||||||
## 命令速查
|
## 命令速查
|
||||||
@@ -38,7 +38,7 @@ python3 $S --check # 输出 NEW:533,532 或 NONE(供 n8n 分支)
|
|||||||
python3 $S --extract pending # 提取所有未处理期(n8n 每日流程推荐)
|
python3 $S --extract pending # 提取所有未处理期(n8n 每日流程推荐)
|
||||||
python3 $S --extract 533 # 指定期 / latest / all(已提取的需 --force 覆盖)
|
python3 $S --extract 533 # 指定期 / latest / all(已提取的需 --force 覆盖)
|
||||||
python3 $S --status # 状态表(期号/日期/HTML/提取/文章数)
|
python3 $S --status # 状态表(期号/日期/HTML/提取/文章数)
|
||||||
# 可选: --feed URL / --dir PATH / --force(数据目录默认 ~/Workspace/nexus/Hermes/xingzhi/sreweekly/)
|
# 可选: --feed URL / --dir PATH / --force(数据目录默认 ~/Workspace/nexus/sreweekly/)
|
||||||
```
|
```
|
||||||
|
|
||||||
- 所有命令**幂等**:重复扫描不重复入库,重复提取自动跳过已提取的期
|
- 所有命令**幂等**:重复扫描不重复入库,重复提取自动跳过已提取的期
|
||||||
|
|||||||
@@ -8,7 +8,7 @@ SRE Weekly 抓取与文章提取脚本
|
|||||||
|
|
||||||
设计给 n8n 定时任务调用,通过不同参数驱动,脚本自身不发送邮件。
|
设计给 n8n 定时任务调用,通过不同参数驱动,脚本自身不发送邮件。
|
||||||
|
|
||||||
目录结构(默认工作目录 ~/Workspace/nexus/Hermes/xingzhi/sreweekly/):
|
目录结构(默认工作目录 ~/Workspace/nexus/sreweekly/):
|
||||||
sreweekly/
|
sreweekly/
|
||||||
├── manifest.json # 状态记录(每期: html 是否保存、文章是否提取、文章数)
|
├── manifest.json # 状态记录(每期: html 是否保存、文章是否提取、文章数)
|
||||||
├── html/<id>-<日期>.html # 每期原始 HTML(feed 的 content:encoded 原样保存)
|
├── html/<id>-<日期>.html # 每期原始 HTML(feed 的 content:encoded 原样保存)
|
||||||
@@ -28,7 +28,7 @@ SRE Weekly 抓取与文章提取脚本
|
|||||||
|
|
||||||
选项:
|
选项:
|
||||||
--feed URL RSS 地址(默认 https://sreweekly.com/feed/)
|
--feed URL RSS 地址(默认 https://sreweekly.com/feed/)
|
||||||
--dir PATH 工作目录(默认 ~/Workspace/nexus/Hermes/xingzhi/sreweekly/)
|
--dir PATH 工作目录(默认 ~/Workspace/nexus/sreweekly/)
|
||||||
--force 重新提取已提取过的期(覆盖旧文件)
|
--force 重新提取已提取过的期(覆盖旧文件)
|
||||||
"""
|
"""
|
||||||
from html.parser import HTMLParser
|
from html.parser import HTMLParser
|
||||||
@@ -40,7 +40,7 @@ except ImportError:
|
|||||||
sys.exit("缺少依赖: 请先执行 pip3 install feedparser")
|
sys.exit("缺少依赖: 请先执行 pip3 install feedparser")
|
||||||
|
|
||||||
DEFAULT_FEED = "https://sreweekly.com/feed/"
|
DEFAULT_FEED = "https://sreweekly.com/feed/"
|
||||||
DEFAULT_DIR = os.path.expanduser("~/Workspace/nexus/Hermes/xingzhi/sreweekly")
|
DEFAULT_DIR = os.path.expanduser("~/Workspace/nexus/sreweekly")
|
||||||
|
|
||||||
# ---------------------------------------------------------------- manifest
|
# ---------------------------------------------------------------- manifest
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user