
Task 1 · 环境准备与课前导读 · 打卡笔记JSON 原始结果{ shell: { powershell: 5.1.19041, bash: GNU bash 5.1.16 }, python: { version: 3.12.4, executable: .venv\\Scripts\\python.exe }, python_venv: { exists: true, version: Python 3.12.4 }, pip_check: { ok: true, output: No broken requirements found. }, conda: conda 24.11.3, git: { version: git version 2.53.0.windows.2, user.name: jackiebox }, git_repo: { ok: true, last_commit: 66ecb86 docs: 更新 sidebar 链接, remote: https://gitee.com/zouzhi/easy-data-x-ai.git }, ssh_key: [id_ed25519.pub], network: { github.com: true, gitee.com: true, api.deepseek.com: true }, api: { key_len: 35, base_url: https://api.deepseek.com/v1, ok: true }, d1_1: { ok: true, output: RAG检索增强生成是一种让大模型先从外部知识库检索相关信息再基于这些信息生成回答的技术… } } 环境搭建要点Windows 用户参考1. 代码仓库拉取GitHub 在部分网络环境可能超时我直接用 Gitee 镜像git clone --depth 1 https://gitee.com/zouzhi/easy-data-x-ai.git2. Python 虚拟环境 清华镜像cd easy-data-x-ai python -m venv .venv .\.venv\Scripts\python.exe -m pip install --upgrade pip -i https://pypi.tuna.tsinghua.edu.cn/simple .\.venv\Scripts\python.exe -m pip install -r code/requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple .\.venv\Scripts\python.exe -m pip check3. 模型 API 配置DeepSeek课程默认走 SiliconFlow / DashScope我用的是 DeepSeekOpenAI 兼容做了两件事(a) 升级 code/config.py 为自动 fallback 体系# 优先探测顺序DeepSeek → SiliconFlow → DashScope → OpenAI # 未配置的自动回退到下一个可用 provider from config import Config llm init_chat_model( Config.get_model(tencent/Hunyuan-MT-7B), # SiliconFlow 别名自动映射为 deepseek-chat model_provideropenai, **Config.get_llm_init_kwargs(), )(b) 写 code/.env Windows 用户环境变量双保险DEEPSEEK_API_KEYsk-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx DEEPSEEK_BASE_URLhttps://api.deepseek.com/v1 课前导读学习笔记1 · 大模型的本质与边界核心观点大模型不是会思考的机器而是一个条件概率生成器——基于训练数据中的统计关联预测下一个最可能的 token。三个核心边界经常被忽略1.幻觉Hallucination*模型不知道自己不知道什么纯靠概率分布生成没有事实校验机制2.上下文窗口限制单次对话能看到的 token 有限deepseek-chat 约 128K超出就遗忘3.训练数据的静态性知识停在训练截止日期之后对新事件一无所知和我之前的认知差异以前以为 RAG 只是给模型喂资料现在理解它是主动弥补边界缺陷的手段——把静态知识转成动态检索在推理时注入最新事实。2 · AI Agent 全景图核心观点Agent ≠ 更强的 ChatGPT而是一个感知 → 推理 → 行动 → 观察的循环系统。用户提问 → 模型推理要不要用工具→ 调用工具搜知识库/查数据库→ 观察工具结果 → 再次推理 → 最终回答或继续行动