跳转至

影音、PDF 与文本施工中节点

开发状态:本分类中的节点均处于开发中,不保证可用性。

这些页面只记录当前节点菜单公开的设计意图与主要端口。节点行为、格式支持和结果结构都可能变化,不应承担重要自动化。

视频与影像

  • 视频:计划读取本地视频或其他影像素材,并拆出画面、分辨率、帧率及最多八路音频数据。
  • 影音提取/合成:计划在影像与音频数据之间执行提取、组合或重新封装。

PDF

  • 读取PDF:计划从文件路径读取 PDF,返回文档信息,并可按正向或倒数页码取得单页文档。
  • PDF智能旋转矫正:计划分析 PDF 页面方向并生成经过旋转矫正的文档。
  • PDF智能页码排序:计划分析页面内容或页码线索,对 PDF 页面顺序进行整理。
  • PDF合并:计划按照输入端口顺序合并多份 PDF 文档。
  • 图像转PDF:计划把输入图像封装为 PDF 文档。
  • PDF页转图像:计划按页码和 DPI 把 PDF 页面渲染为 RGB 与 Alpha 影像。
  • PDF转图层:计划把 PDF 页面转换成可继续处理的图层栈。
  • 图层转PDF:计划把图层栈重新组织为 PDF 文档。
  • PDF印章:计划把指定图像作为印章放置到 PDF 页面,并支持位置、宽度、旋转和透明度参数。

音频与语音

  • 字幕生成:计划分析音频中的语音片段并生成字幕文本。
  • 字幕转语音:计划使用所选语音模型把字幕文本转换为音频。
  • Qwen3 语音:计划根据文本及可选参考音频、参考文本生成语音。
  • 去除人声:计划从音频中分离或抑制人声,并返回处理后的音频。
  • 去除背景音乐:计划从音频中分离或抑制背景音乐,并返回处理后的音频。

识别、模型与翻译

  • ONNX 推理:计划使用所选 ONNX 模型处理媒体输入,并返回模型结果文本。
  • YOLOv8 检测:计划使用所选检测模型分析媒体内容,并按置信度、IoU 和 TopK 参数返回检测结果。
  • OCR 识别:计划识别媒体中的文字,并同时提供纯文本与结构化结果。
  • Ollama 文本:计划把文本、系统提示和随机性参数提交给本地文本模型,并返回生成结果。
  • 轻量翻译:计划把输入字符串翻译为目标文本,供字幕或其他文本流程继续使用。

文本与保存

  • 字符串尺寸估算:计划根据字符串和字号估算文本的宽度与高度。
  • 字符串转文本:计划把普通字符串转换为带字体、填充、描边、行高、宽度和对齐信息的文本对象。
  • 字符串转图像:计划把字符串排版并栅格化为 RGB 与 Alpha 影像。
  • 字符串转Path:计划把字符串轮廓转换为路径,并返回路径尺寸与成功状态。
  • 标点转空格:计划把输入文本中的标点替换为指定数量的空格。
  • 替换字符:计划查找输入文本中的指定字符或字符串,并替换为新内容。
  • 保存:计划把影像、音频、PDF 或其他实体写入指定路径。
  • 双语字幕合并:计划按时间或条目顺序合并两份字幕文本,生成双语字幕结果。