影音、PDF 与文本施工中节点¶
开发状态:本分类中的节点均处于开发中,不保证可用性。
这些页面只记录当前节点菜单公开的设计意图与主要端口。节点行为、格式支持和结果结构都可能变化,不应承担重要自动化。
视频与影像¶
PDF¶
- 读取PDF:计划从文件路径读取 PDF,返回文档信息,并可按正向或倒数页码取得单页文档。
- PDF智能旋转矫正:计划分析 PDF 页面方向并生成经过旋转矫正的文档。
- PDF智能页码排序:计划分析页面内容或页码线索,对 PDF 页面顺序进行整理。
- PDF合并:计划按照输入端口顺序合并多份 PDF 文档。
- 图像转PDF:计划把输入图像封装为 PDF 文档。
- PDF页转图像:计划按页码和 DPI 把 PDF 页面渲染为 RGB 与 Alpha 影像。
- PDF转图层:计划把 PDF 页面转换成可继续处理的图层栈。
- 图层转PDF:计划把图层栈重新组织为 PDF 文档。
- PDF印章:计划把指定图像作为印章放置到 PDF 页面,并支持位置、宽度、旋转和透明度参数。
音频与语音¶
- 字幕生成:计划分析音频中的语音片段并生成字幕文本。
- 字幕转语音:计划使用所选语音模型把字幕文本转换为音频。
- Qwen3 语音:计划根据文本及可选参考音频、参考文本生成语音。
- 去除人声:计划从音频中分离或抑制人声,并返回处理后的音频。
- 去除背景音乐:计划从音频中分离或抑制背景音乐,并返回处理后的音频。
识别、模型与翻译¶
- ONNX 推理:计划使用所选 ONNX 模型处理媒体输入,并返回模型结果文本。
- YOLOv8 检测:计划使用所选检测模型分析媒体内容,并按置信度、IoU 和 TopK 参数返回检测结果。
- OCR 识别:计划识别媒体中的文字,并同时提供纯文本与结构化结果。
- Ollama 文本:计划把文本、系统提示和随机性参数提交给本地文本模型,并返回生成结果。
- 轻量翻译:计划把输入字符串翻译为目标文本,供字幕或其他文本流程继续使用。