《极客时间-多模态大模型训练营》是一套面向多模态人工智能技术与应用实践的系统化训练课程,围绕文本、图像、语音、视频等多种数据形态展开,重点帮助学习者理解多模态大模型的核心原理、训练方法、应用架构与工程落地。课程适合AI算法工程师、大模型开发者、程序员、产品经理以及希望深入学习多模态技术的相关从业者。

课程从多模态AI基础知识入手,帮助学习者建立对视觉语言模型(VLM)、多模态大语言模型以及跨模态理解与生成技术的整体认知。通过梳理文本、图像、音频和视频之间的信息表示与交互方式,学习者能够进一步理解多模态模型为什么能够“看懂图片、理解文字、分析视频”,以及不同模态数据如何通过编码器、投影层和大语言模型进行融合。

在核心技术方面,课程重点涉及Transformer、视觉编码器、视觉语言模型、多模态对齐、指令微调、监督微调以及模型评测等关键内容。同时结合当前主流多模态模型的发展思路,深入理解预训练数据构建、图文数据处理、指令数据生成、模型训练和效果优化等环节,帮助学习者从“使用多模态模型”进一步走向“理解和训练多模态模型”。

课程还强调多模态大模型的实际应用能力,围绕图像理解、文档解析、视觉问答、OCR、图片分析、视频理解、语音交互以及多模态Agent等场景展开。学习者可以进一步掌握如何将视觉、语言、语音等能力组合到实际业务中,例如智能客服、内容审核、工业视觉、教育辅导、医疗影像辅助分析、智能办公和数字人等方向,从而理解多模态AI如何从实验环境走向真实应用。

在工程实践层面,课程关注模型部署、推理优化、数据处理、资源管理和应用开发等问题,帮助学习者建立完整的多模态项目思维。从数据准备、模型选择、训练微调,到推理服务和业务集成,逐步掌握多模态应用开发的完整流程。

总体来看,《极客时间-多模态大模型训练营》兼顾理论基础、模型训练与工程实践,将当前热门的视觉语言模型、多模态理解与生成技术进行系统串联。通过学习,可以帮助学习者构建从单模态AI到多模态大模型的知识体系,提升模型训练、应用开发和AI项目落地能力,为进一步从事多模态算法、大模型工程及智能应用开发打下扎实基础。

课程截图:

课程目录:

极客时间-多模态大模型训练营/
│ ├── 第0周:直播答疑+开营直播回放/
│ │ ├── 0-1 开营直播回放.mp4 (149.76 MB)
│ │ ├── 0-2 直播答疑-20251025.mp4 (97.08 MB)
│ │ ├── 0-3 直播答疑-20251108.mp4 (145.30 MB)
│ │ ├── 0-4 直播答疑-20251122.mp4 (233.97 MB)
│ │ └── 第0周:直播答疑+开营直播回放资料.png (0.48 MB)
│ ├── 第1周:机器学习与深度学习基础(上)/
│ │ ├── 1-1 课程概述.mp4 (66.39 MB)
│ │ ├── 1-2 常见机器学习任务与算法:机器学习任务类型.mp4 (57.09 MB)
│ │ ├── 1-3 常见机器学习任务与算法:机器学习十大算法.mp4 (111.67 MB)
│ │ ├── 1-4 常见机器学习任务与算法:机器学习的任务步骤.mp4 (91.38 MB)
│ │ ├── 1-5 深度学习任务版图.mp4 (75.26 MB)
│ │ └── 1-6 深度学习算法.mp4 (71.32 MB)
│ ├── 第2周:机器学习与深度学习基础(下)/
│ │ ├── 2-1 深度学习训练要素.mp4 (101.57 MB)
│ │ ├── 2-2 强化学习最小闭环.mp4 (121.43 MB)
│ │ ├── 2-3 PyTorch基础与工程要素.mp4 (51.20 MB)
│ │ └── 2-4 实战:电商SKU卡生成.mp4 (91.31 MB)
│ ├── 第3周:大模型微调与落地(上)/
│ │ ├── 3-1 大模型的演进历史(一).mp4 (87.85 MB)
│ │ ├── 3-2 大模型的演进历史(二).mp4 (87.96 MB)
│ │ ├── 3-3 从AI到AGI到ASI(一).mp4 (84.49 MB)
│ │ ├── 3-4 从AI到AGI到ASI(二).mp4 (81.62 MB)
│ │ ├── 3-5 Transformer核心原理.mp4 (122.07 MB)
│ │ └── 第3周:大模型微调与落地(上)资料.zip (1.83 MB)
│ ├── 第4周:大模型微调与落地(下)/
│ │ ├── 4-1 Transformer核心原理的演示.mp4 (231.80 MB)
│ │ ├── 4-2 知识工程与多模态RAG.mp4 (131.42 MB)
│ │ ├── 4-3 微调方法与参数高效训练(一).mp4 (113.99 MB)
│ │ ├── 4-4 微调方法与参数高效训练(二).mp4 (100.23 MB)
│ │ ├── 4-5 提示词工程和模型压缩优化.mp4 (94.95 MB)
│ │ └── 4-6 实战:可溯源的问答助手.mp4 (77.04 MB)
│ ├── 第5周:多模态全景认知/
│ │ ├── 5-1 多模态的定义与边界.mp4 (46.90 MB)
│ │ ├── 5-2 多模态数据与表征.mp4 (74.60 MB)
│ │ ├── 5-3 多模态模型架构.mp4 (64.79 MB)
│ │ ├── 5-4 多模态任务类型.mp4 (30.91 MB)
│ │ ├── 5-5 多模态应用场景.mp4 (54.26 MB)
│ │ ├── 5-6 多模态实战.mp4 (167.53 MB)
│ │ ├── 5-7 音频模态扩展.mp4 (25.07 MB)
│ │ └── 第5周:多模态全景认知文档.zip (1.83 MB)
│ ├── 第6周:虚拟人生成与交互技术/
│ │ ├── 6-1 虚拟人生成全景.mp4 (45.67 MB)
│ │ ├── 6-2 图像生成与条件控制(一).mp4 (134.66 MB)
│ │ ├── 6-3 图像生成与条件控制(二).mp4 (107.45 MB)
│ │ ├── 6-4 虚拟人的大脑.mp4 (130.88 MB)
│ │ ├── 6-5 虚拟人的声音情感.mp4 (150.69 MB)
│ │ ├── 6-6 虚拟人的口型与驱动.mp4 (149.67 MB)
│ │ ├── 6-7 虚拟人直播.mp4 (45.19 MB)
│ │ └── 6-8 虚拟人案例实操.mp4 (109.57 MB)
│ └── 第7周:多模态 OCR 与智能翻译链路/
│ │ ├── 7-1 OCR的全景认知.mp4 (69.00 MB)
│ │ ├── 7-2 传统OCR技术机制.mp4 (118.68 MB)
│ │ ├── 7-3 生成式与Transformer式OCR(一).mp4 (96.52 MB)
│ │ ├── 7-4 生成式与Transformer式OCR(二).mp4 (89.87 MB)
│ │ ├── 7-5 版面与表格结构解析.mp4 (119.49 MB)
│ │ ├── 7-6 手写OCR与多语种.mp4 (103.73 MB)
│ │ ├── 7-7 OCR到翻译链路与RAG落地.mp4 (79.82 MB)
│ │ └── 第7周:多模态 OCR 与智能翻译链路文档.png (0.48 MB)

声明:本站所发布的一切视频课程仅限用于学习和研究目的;不得将上述内容用于商业或者非法用途,否则,一切后果请用户自负。本站所有课程来自网络,版权争议与本站无关。如有侵权请联系客服QQ:1960026872或登录本站账号进入个人中心提交工单留言反馈,我们将第一时间处理!
侵权联系与免责声明: 1、本站资源所有内容均收集于网络,与本网站立场无关 2、本站所有资源收集于互联网,由用户分享,该帖子作者与IT课程网不享有任何版权,如有侵权请联系本站删除 3、本站部分内容转载自其它网站,但并不代表本站赞同其观点和对其真实性负责 4、如本帖侵犯到任何版权问题,请立即告知本站,本站将及时予与删除并致以最深的歉意。如有侵权请联系联系客服QQ:1960026872或登录本站账号进入个人中心提交工单留言反馈,我们将第一时间处理!