ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DolphinScheduler 教程:30 分钟从安装到跑通第一个可视化工作流

DolphinScheduler 教程:30 分钟从安装到跑通第一个可视化工作流 DolphinScheduler 教程30 分钟从安装到跑通第一个可视化工作流【免费下载链接】dolphinschedulerApache DolphinScheduler is the modern data orchestration platform. Agile to create high performance workflow with low-code项目地址: https://gitcode.com/GitHub_Trending/dol/dolphinschedulerDolphinScheduler 是一个可视化 DAG 任务调度系统把各种数据作业在网页上拖拽成工作流到点自动执行或手动触发失败还能实时告警。如果你现在靠 cron 和一串脚本跑批处理任务这篇教程带你装起它、弄清它能做什么、以及出问题时该从哪下手。 DolphinScheduler 解决什么问题用 cron 跑数据任务痛的地方通常有三处依赖关系没法表达。任务 B 要用任务 A 的产出cron 只能写个sleep赌时间A 一延迟B 就在脏数据上跑。失败没人知道。任务挂了第二天报表空了才发现。没有统一入口。任务散在几台机器上想看谁在跑、谁失败了得逐台登录翻日志。DolphinScheduler 的答案是 DAG有向无环图可以理解成一张任务流程图节点 A 产出结果B 消费 A 的产出C 再消费 B 的A 没成功 B 就不会启动。你只负责画流程图按什么顺序跑、在哪台机器上跑、失败了怎么办都由它处理。另外几件 cron 做不了的事补数上个月的数据算错了在界面上圈一个历史日期区间它会按天把整个工作流自动重跑一遍多租户与权限不同团队用不同项目项目和数据源各自控制权限告警任务失败或超时自动发钉钉、飞书、邮件等通知版本控制工作流的每次改动都有版本可以对比、回退 DolphinScheduler 怎么安装4 种部署方式选哪种官方提供 Standalone、Cluster含伪集群、Docker、Kubernetes 四种部署方式。新手从 Standalone 开始。前置条件只有一个装好 JDK 1.8 或 11。下载官方二进制包解压后在包目录里执行bash ./bin/dolphinscheduler-daemon.sh start standalone-server浏览器打开http://localhost:12345/dolphinscheduler/ui用默认账号admin、密码dolphinscheduler123登录即可。Standalone 有两点要心里有数默认用 H2 内存数据库重启后数据会清空官方建议只在 20 个以下工作流的体验场景使用。想留存元数据需要配置 MySQL 或 PostgreSQL 等外部数据库见 Standalone 安装文档。生产环境则按规模选伪集群单机多进程从体验到生产的过渡形态、集群部署多机部署、Dockercompose 一键拉起 PostgreSQL 和 Zookeeper或 Kubernetes仓库里自带 Helm chart见 deploy/kubernetes/。✅ 怎么跑通第一个 DolphinScheduler 工作流登录之后按这个顺序操作官方快速上手教程 有图文步骤可以对照创建租户。租户是真正执行任务的 Linux 账号你登录用的 admin 叫用户是操作界面的任务实际以租户身份在机器上跑。不建也会落到默认租户但建议显式创建。给用户分配租户。在 安全中心 → 用户管理 里把租户勾给 admin。创建项目。工作流必须属于某个项目先在 项目管理 里建一个叫 tutorial 的项目。画工作流。进入项目 → 工作流定义 → 创建工作流。右侧画布就是 DAG 编辑器把左侧的 Shell 任务拖进来写一行echo hello。上线并执行。把工作流置为上线状态点击执行在 工作流实例 页面能看到当前跑到哪个节点点任务节点还能看执行日志。任务类型不止 Shell。仓库的 任务插件目录 就是内置清单SQL、Python、HTTP、Flink、Spark、数据同步等等都有。SQL 任务要连库先在 数据源管理 里配好数据源跑任务时直接选即可。DolphinScheduler 架构速览各组件负责什么想理解它为什么能上集群可以花一分钟认识四个角色API你看到的 Web 界面和 REST 接口默认端口 12345无状态可以水平扩展Master调度者把要跑的工作流拆解成任务分派给 WorkerWorker执行者真正跑任务并回传结果Alert告警服务任务失败时发钉钉、飞书、邮件Master 和 Worker 都是谁能跑谁跑可以随负载加节点组件之间靠注册中心协调默认 Zookeeper。高可用不是额外配置出来的是架构本身的样子。 DolphinScheduler 出问题先看哪排障按这个顺序来工作流没触发先确认工作流是上线状态、定时时间写对了。下线的工作流到点也不会跑。任务失败直接看任务实例的日志。系统支持远程日志不用登录服务器翻文件。服务状态Standalone 可以用bash ./bin/dolphinscheduler-daemon.sh status standalone-server确认进程是否存活。系统健康监控页面实时展示 Master、Worker 和数据库的资源占用与负载哪里快撑不住一眼就能看到无需逐台登录。数据消失了如果你用的是 Standalone重启后刚建的数据没了属于正常现象——H2 内存数据库重启即清空这正是它只适合体验的原因。下一步做什么最快的学习方式是动手起一个 Standalone按快速上手把 Shell 工作流跑通再配一个邮件告警看看失败通知长什么样。之后按章节精读官方中文文档任务类型、参数传递、告警渠道各有专门一章遇到问题可以去项目社区提 Issue想深入就看贡献指南从一个小修改开始参与。【免费下载链接】dolphinschedulerApache DolphinScheduler is the modern data orchestration platform. Agile to create high performance workflow with low-code项目地址: https://gitcode.com/GitHub_Trending/dol/dolphinscheduler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表