ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

云端数据科学入门:云计算基础、服务模型与数据科学上云实战(Data-Science-For-Beginners 课程解析)

云端数据科学入门:云计算基础、服务模型与数据科学上云实战(Data-Science-For-Beginners 课程解析) 云端数据科学入门云计算基础、服务模型与数据科学上云实战Data-Science-For-Beginners 课程解析【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners导读本文基于开源课程 Data-Science-For-Beginners 第五章《Data Science in the Cloud》的引言课5-Data-Science-In-Cloud/17-Introduction/README.md系统讲解云计算的核心原理、公有云/私有云/混合云的部署形态、IaaS/PaaS/SaaS 三种服务模型以及数据科学家为何应该把项目搬上云端。读完本文你将掌握如何判断自己的数据科学工作流适合哪种云服务形态、云服务能为存储、集成、处理、分析与机器学习等环节解决哪些实际问题并通过课程内置的课后测验与课后作业完成一次从概念到实战的知识闭环。什么是云云The Cloud即云计算Cloud Computing是指通过互联网交付一系列按需付费pay-as-you-go的计算服务这些服务托管在远程基础设施之上具体包括存储、数据库、网络、软件、分析与智能服务等解决方案。与其自建机房、自购硬件不如按用量租用他人的基础设施与服务。三种部署形态公有云、私有云与混合云课程将云按所有权与访问范围划分为三类公有云Public cloud由第三方云服务提供商拥有并运营其计算资源通过互联网向公众开放交付。使用者无需关心底层硬件维护成本分摊到各租户。私有云Private cloud仅供单一企业或组织独占使用的云计算资源服务和基础设施在私有网络上维护安全性与可控性更高适合对数据主权有严格要求的场景。混合云Hybrid cloud将公有云与私有云结合的系统。用户保留本地数据中心on-premises的同时允许数据和应用程序运行在一个或多个公有云上兼顾敏感数据的本地管控与弹性算力的按需扩展。三种服务模型IaaS、PaaS 与 SaaS大多数云服务可归入以下三大类别服务模型用户租用/获得什么用户无需关心什么典型例子IaaS基础设施即服务服务器、虚拟机VM、存储、网络、操作系统等 IT 基础设施硬件采购与机房运维云虚拟机、托管存储PaaS平台即服务开发、测试、交付和管理软件应用的一整套环境支撑开发所需的服务器、存储、网络、数据库等底层基础设施云上的数据科学平台、应用托管平台SaaS软件即服务通过互联网按需通常按订阅访问软件应用软件的托管、底层基础设施与升级、安全补丁等维护工作在线 BI 工具、云笔记这三者的区别在课程配套测验中也有对应考察见 quiz-app/src/assets/translations/en/group-5.json 中第 33 题哪种云计算服务提供对软件应用的访问而无需维护软件——答案正是SaaS。目前市场上规模最大的云服务提供商包括Amazon Web ServicesAWS、Google Cloud PlatformGCP与Microsoft Azure它们都在围绕数据科学构建各自的托管产品矩阵。为什么数据科学要选择云端开发者与 IT 从业者选择云的七大理由课程总结出以下核心动因创新Innovation可直接将云厂商开发的创新服务集成进自己的应用快速获得语音、视觉、推荐等开箱即用的能力。灵活性Flexibility只为自己需要的服务付费按需选择随业务演进调整服务组合。预算Budget免去购买软硬件、自建与运营本地数据中心的前期投资按用量付费即可。可扩展性Scalability资源随项目需求伸缩应用可以在任何时刻按外部因素增减计算能力、存储和带宽。生产力Productivity把机房运维等可外包的工作交给云厂商把时间聚焦在业务本身。可靠性Reliability云提供多种持续备份机制可建立灾难恢复disaster recovery计划即使面对危机也能保持业务运行。安全性Security借助云厂商提供的策略、技术与管控手段强化项目安全。数据科学家面临的具体挑战与云端解法进一步聚焦数据科学家与数据工程师的日常工作云在以下五个环节提供了直接的解决方案存储海量数据无需购买、管理和保护大型服务器可直接把数据存进云端例如 Azure Cosmos DB、Azure SQL Database 与 Azure Data Lake Storage 等存储方案。执行数据集成Data Integration数据集成是数据科学中从数据收集迈向行动的关键环节。借助云端集成服务如 Data Factory可以从多个来源采集、转换数据并整合进统一的数据仓库。处理数据海量数据处理需要巨大的算力并非人人都拥有足够强大的机器。许多团队选择直接调用云的巨型算力来运行和部署解决方案。使用数据分析服务诸如 Azure Synapse Analytics、Azure Stream Analytics、Azure Databricks 等服务帮助把数据转化为可执行的洞察。使用机器学习与数据智能服务无需从零搭建算法可直接使用云厂商提供的机器学习服务如 Azure ML以及认知服务speech-to-text、text-to-speech、computer vision 等。配套测验的第 32 题课前也考察了什么是云与云的优势云被定义为通过互联网提供的一系列按需付费计算服务其优势关键词是灵活性、可扩展性、可靠性、安全性见 quiz-app/src/assets/translations/en/group-5.json。云端数据科学的两个典型实例实例一实时社交媒体情感分析Real-time Social Media Sentiment Analysis这是一个机器学习入门者最常见的实战场景。假设你运营一家新闻媒体网站希望借助实时数据了解读者对哪些内容感兴趣可以构建一个程序对 Twitter 发布中与读者相关话题的数据做实时情感分析。核心观测指标有两个特定话题hashtag相关的推文数量volume推文围绕指定话题的情感倾向sentiment由执行情感分析的分析工具得出。该项目在云端的实施步骤如下为流式输入创建一个事件中心Event Hub用于从 Twitter 采集数据配置并启动一个Twitter 客户端应用调用 Twitter Streaming API创建一个Stream Analytics 作业指定作业的输入input与查询query创建**输出接收器output sink**并指定作业输出启动作业。完整流程的官方文档教程可在 Azure Stream Analytics 文档中检索《Twitter sentiment analysis in real-time with Azure Stream Analytics》获得本课程亦在5-Data-Science-In-Cloud章节目录中将其列为必读参考见 5-Data-Science-In-Cloud/17-Introduction/README.md。实例二科学论文分析Scientific Papers Analysis第二个实例来自本课程作者之一 Dmitry Soshnikov 创建的 COVID 论文分析工具。该项目展示了如何构建一个从海量科学论文中抽取知识、获得洞察、帮助研究者高效浏览大型论文库的工具其云端技术栈分为四步使用Text Analytics for Health认知服务抽取并预处理论文中的医学实体与信息使用Azure ML将处理过程并行化加速大规模语料的处理使用Cosmos DB完成信息的存储与查询使用Power BI构建交互式仪表盘进行数据探索与可视化。从这两个实例可以看到云服务能够以多种方式支撑数据科学全流程——从流式采集、实时分析到大规模批处理、知识存储与可视化呈现。本课在课程体系中的位置从云概念到云端项目本引言课是整个《Data Science in the Cloud》章节5-Data-Science-In-Cloud/README.md的第一课为后续两课奠定概念基础。章节总览明确指出后续将基于一份心衰heart failure数据集以两种方式完成训练—部署—消费一个预测模型验证心衰发生概率评估任务低代码/无代码方式Low code/No code见 18-Low-Code/README.md。在 Azure ML Studio 中以图形界面完成工作区创建、计算资源配置、数据集加载与 AutoML 训练并一键部署 Web 服务、生成 REST 端点供外部应用消费。适合快速验证项目可行性、构建概念验证POC。Azure ML SDK 方式见 19-Azure/README.md。以 Python SDK 在 Jupyter Notebook 中编程实现完全相同的流程核心调用链包括Workspace.from_config()加载工作区、Experiment创建实验、AmlCompute.provisioning_configuration()创建计算集群、AutoMLConfig配置自动机器学习关键参数如experiment_timeout_minutes、primary_metric、label_column_name等、Model.deploy()配合InferenceConfig与AciWebservice完成部署最终通过aci_service.run()消费端点。适合生产就绪与全流程自动化。两种方式的对比低代码上手快、无需编程经验、适合 POCSDK 需要编程基础但支持生产级自动化恰好呼应本课强调的云为数据科学提供从存储到智能服务的全链路能力这一主线。课后任务市场调研Market Research本课配套作业位于 5-Data-Science-In-Cloud/17-Introduction/assignment.md要求如下Instructions在本课中你了解到存在多个重要的云服务提供商。请做一次市场调研发现各家能为数据科学家提供什么能力——它们的服务是否可比撰写一篇论文描述其中至少三家云服务提供商的数据科学产品。评分标准Rubric优秀Exemplary合格Adequate待改进Needs Improvement一篇一页论文描述三家云提供商的数据科学产品并区分其差异提交了一篇较短的论文提交了论文但未完成分析建议调研时围绕本课提到的能力维度展开对比存储方案对象存储/数据湖、数据集成服务、流式与批处理分析、AutoML 与认知服务、部署与端点的易用性并结合自身项目场景给出选型结论。小结云 按需付费的互联网计算服务按部署形态分为公有云、私有云、混合云按服务粒度分为 IaaS、PaaS、SaaS。云为数据科学提供的核心价值在于存储、集成、处理、分析、机器学习五大环节同时带来创新、灵活、低成本、可扩展、高生产力、高可靠与安全等收益。通过实时社交媒体情感分析与 COVID 论文分析两个实例可以直观看到云服务在流式分析、认知服务、并行计算、NoSQL 存储与可视化仪表盘上的完整组合应用。本课是整个云端数据科学章节的起点后续将分别以低代码与 SDK 两种方式在 Azure 上完成端到端的机器学习项目建议在动手前先完成本课的市场调研作业建立对主流云厂商数据科学产品的基本认知。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表