-
万字长文讲透 LLM 核心:Transformer 架构原理解析
文章全面且深入地剖析了作为大型语言模型(LLM)基石的 Transformer 架构。从基础概念入手,详细讲解了文本如何通过分词、词嵌入和位置编码转化为模型可处理的数字表示。核心部分聚焦于注意力机制,包括自注意力、多头注意力和因果注意力,阐释了模型如何捕捉词语间的复杂依赖关系,并有效解决了传统 RNN 在处理长文本时面临的长距离依赖和并行计算等问题和挑战。此外,文章还介绍了前馈神经网络(FFN/M… -
为您的 Web 应用程序构建可伸缩的访问控制
本文探讨了可伸缩的访问控制系统,重点介绍了基于属性的访问控制 (ABAC) 相对于基于角色的访问控制 (RBAC) 的优势。它深入探讨了如何在 React 应用程序中使用 CASL 和自定义框架实现 ABAC,涵盖了定义、验证和执行策略的最佳实践。文章强调了在前端和后端系统中实施访问控制以确保安全性和效率的重要性。此外,它还讨论了大规模 ABAC 实施的性能优化策略和可扩展性挑战,提供了实际应用场… -
完整的 671B MoE DeepSeek R1 怎么塞进本地化部署?详尽教程大放送!
文章详细介绍了如何将 DeepSeek R1 671B MoE 模型本地化部署,通过动态量化技术压缩模型至 131GB,降低硬件要求。文中解释了如何通过量化方法压缩模型体积,以及如何选择适合的硬件配置以满足内存和显存需求。文章接着描述了使用 ollama 工具的部署步骤,并提供了实际测试结果和硬件建议,最后总结了如何根据具体需求选择合适的量化版本。 AIxiv专栏是机器之心发布学术、技术内容的栏目… -
大神 Andrej 的最新 AI 课: 大语言模型 LLM 深入详解 | 5 万字完整版·附视频
本文是 Web3 天空之城整理的 Andrej Karpathy 关于大语言模型 (LLM) 的 3.5 小时讲座的 5 万字全文。讲座深入探讨了 ChatGPT 等 LLM 的技术原理,涵盖了模型开发的完整训练流程,以及如何理解其“心理模型”,并如何在实际应用中最好地利用它们。内容包括:预训练阶段的数据处理、分词 (Tokenization)、Transformer 神经网络训练,推理阶段的生成… -
《整洁代码手册:如何编写更佳的敏捷软件开发代码》
《整洁代码手册》文章提供了一份编写整洁、易维护代码的实用指南,尤其适用于敏捷软件开发。文章强调了劣质代码相较于整洁代码在长期维护上的高昂成本,凸显了整洁编码实践在敏捷环境中适应性和可持续性的重要性。文章对比了编码风格混乱与整洁的开发者,阐述了快速但不可持续的编码方式与持续注重质量的开发方式之间的差异。文章澄清了 AI 无法解决因代码混乱造成问题的误解,并介绍了 12 个关键的整洁代码设计模式,涵盖… -
2 万字全文: 段永平 2025.1.5 浙大师生见面会问答实录无删节
段永平在浙大师生见面会上,围绕学习方法、AI 工具使用、投资策略、创业建议以及人生选择等多个主题,分享了他的深刻见解。他强调了长远眼光和踏实做事的重要性,指出在学习方法和 AI 工具使用上应注重效率提升,但需谨慎避免学术不端行为。在投资决策上,他主张基于对企业、产品和商业模式的深刻理解,而非追求快速赚钱。创业方面,他建议基于强烈的想法和实际需求,而非盲目跟风,同时要具备学习新知识的能力。此外,他还… -
Claude 高阶玩法泄露!Reddit 高赞帖:别只会对 AI 说“帮我修这个 bug”,老手都在配置现成指令库!网友:指挥 AI 是关键
本文深入探讨了 Claude Code 中“指令库”和“斜杠指令”的高阶用法,指出其能显著提升开发者效率,将原本耗时 45 分钟的流程缩短至 2 分钟。文章通过 Reddit 高赞帖引入,揭示了掌握指令库的“老手”与仅停留在简单提示词的普通用户之间的巨大差距。核心在于通过 `.md` 文件定义 AI Agent 的标准操作流程(SOP),实现任务的明确执行、多 Agent 并行协作及任务完成条件的… -
杞坚玮:小爱同学大模型在业务应用中的升级之路
本文介绍了小米小爱同学如何利用 Agent 技术简化语音助手架构和策略,并通过创新性的代码式语义表示和多 Agent 协同调度,提升语义理解和规划能力。针对垂直场景中的挑战,文章阐述了如何通过持续预训练和分阶段微调优化大模型,并利用用户反馈进行强化学习,以及通过压缩 prompt 序列和投机采样等方法提升 Agent 服务响应速度。文章最后展望了小爱同学在主动智能和多模态能力方面的未来优化方向。 … -
DeepSeek 最强专业拆解来了,清交复教授超硬核解读
本文通过五位高校教授的深入分析,全面探讨了 DeepSeek 的技术原理、优化方法及未来发展方向。DeepSeek 通过优化策略显著提升了算力能效,降低了成本,并在写作能力上取得了飞跃。文章详细介绍了 R1 和 V3 模型的技术路线、训练流程及其与 OpenAI o1 的对比。DeepSeek 的创新策略包括 MoE 架构、负载均衡、通信优化和内存优化,展示了中国团队在 AI 领域的独立思考和创新… -
让 AI 打出丝滑连招:编码-部署-自测-改 bug
文章深入探讨了 AI 辅助编程中 AI 生成代码后缺乏自测与迭代的“最后一公里”挑战。为解决这一痛点,作者团队提出并设计了一套测试驱动的 AI 编程闭环工作流,旨在赋予 AI 自主发现、定位、修复代码问题的能力。该工作流涵盖了编码、部署、自测、改 Bug 等核心环节,并通过自动化验收和反馈机制实现。文章详细介绍了其整体架构和核心组件,包括部署 Agent、HSF 调试工具以及自动化调试命令(aut… -
RAG 一周出 Demo,半年上不了线,怎么破?
本文深入剖析了 RAG(Retrieval-Augmented Generation)在产业落地中的核心问题——问题分级。文章指出,尽管 RAG 能够在一周内快速搭建出 Demo,但在实际生产环境中落地却困难重重,主要原因在于 RAG 只能解决显性事实查询和部分隐性事实查询,而企业实际业务中大多数有价值的问题属于可解释性推理和隐性推理查询,这些问题的复杂度和解题难度较高。文章详细探讨了四类问题的挑… -
DeepSeek R1 之后,重新理解推理模型
文章对 DeepSeek R1 推理模型进行了全面解读,明确了推理模型的定义,即擅长解决需要复杂、多步骤生成的问题。分析了推理模型的优缺点,强调其在复杂任务上的优势,以及在简单任务上的低效。详细介绍了 DeepSeek R1 的三个变体:R1-Zero (纯 RL 训练)、R1 (SFT+RL 训练) 和 R1-Distill (蒸馏模型),并对比了它们的技术特点和性能差异,强调了 R1 在纯 R… -
深度|诺奖得主 Hinton:人类当下局面是,旧石器时代的大脑、中世纪的制度与类神的技术
Geoffrey Hinton 在本文中深入探讨了人工智能的本质、发展及其对人类社会的潜在威胁。他指出,智能的本质是学习,而非推理,人工智能通过神经网络进行学习,语言和推理是在视觉和运动控制基础上发展出来的。当前人类面临旧石器时代的大脑、中世纪的制度与类神的技术之间的不匹配,导致技术变革带来的挑战加剧。Hinton 还讨论了人工智能的长期生存威胁,认为可能创造出比人类更智能的系统,这些系统将接管人… -
让 AI 智能体拥有像人类的持久记忆:基于 LangGraph 的长短期记忆管理实践指南
文章详细解析了 AI 智能体(Agent)记忆机制的核心概念及其重要性,区分了短期记忆(Short-term Memory)和长期记忆(Long-term Memory)。重点介绍了 LangGraph 框架下这两种记忆的实现方式:短期记忆通过 Checkpointer 进行会话状态管理和数据库持久化,长期记忆则通过 Store 实现跨线程共享和语义搜索。文章通过 InMemorySaver、Po… -
对话余凯:世界不止刀光剑影,是一部人来人往的江湖故事
文章是地平线创始人兼 CEO 余凯博士的深度访谈口述史。他回顾了从学术界到产业界的职业生涯,包括在西门子、NEC、百度的工作经历,以及 2015 年创立地平线的十年创业历程。余凯分享了其在人工智能领域早期对深度学习的独到见解,以及在百度时期推动中国 AI 发展的关键事件,如竞拍 Geoffrey Hinton 和引入吴恩达。他详细阐述了地平线选择“软硬结合”和聚焦自动驾驶芯片的“反共识”战略,以及… -
【生成式人工智慧與機器學習導論 2025】第 6 講:一堂課搞懂訓練類神經網路的各種訣竅
本课程(文章)围绕神经网络训练中的实用技巧展开,首先提出了一个核心评估框架:任何技巧都应审视其改变了机器学习的哪一步(损失函数、函数范围、最优函数选择),以及其主要目的是改善优化(降低训练损失)还是增强泛化(避免过拟合)。文章随后按此框架,系统性地介绍了梯度下降、AdaGrad、RMSProp、Momentum、Adam 等优化器,Dropout、初始化、预训练等泛化技巧,以及 CNN、残差连接、… -
只靠国产算力与开源数据,端侧模型预训练行不行?我们做到了全流程开源
文章详细介绍了“开元-2B”端侧模型的预训练过程,该模型由鹏城实验室与清华大学 PACMAN 实验室联合开发。核心挑战是在国产算力(华为昇腾 910A)受限和数据质量参差不齐的情况下,训练高效可用的端侧模型。文章阐述了为解决训练稳定性引入的“三明治范数”和“软裁剪”技术,以及为高效利用开源数据而开发的 Kaiyuan-Spark 数据处理框架和“分位标定”方法。此外,还介绍了多阶段动态比例调整、策… -
GLM-4.7 开源!交出“生产级代码”
文章介绍了智谱公司最新开源的大模型 GLM-4.7,该模型重点对编程场景进行了优化。它在编码、推理和智能体三个维度实现了突破,包括多语言编码能力、前端生成质量、工具调用能力以及数学和推理能力的显著提升。GLM-4.7 在多个主流基准测试(如 Claude Code、SWE-bench 等)中表现优异,达到或超越了业界领先水平,特别是在 Code Arena 中位列开源第一、国产第一,并超越了 GP… -
AprielGuard:现代大型语言模型(LLM)系统安全与对抗鲁棒性的守护者
本文介绍了 AprielGuard,一个由 ServiceNow AI 开发的 80 亿参数安全保障模型。AprielGuard 专为现代大型语言模型系统,特别是智能体化的系统设计,提供了一种统一的方法来检测 16 类安全风险(例如,毒性、错误信息、非法活动),以及广泛的对抗性攻击(例如,提示注入、越狱、记忆投毒)。它支持多样的输入格式,包括单独提示、多轮对话和复杂的智能体化工作流(工具调用、推理… -
刚刚,OpenAI 最强图像生成 API 上线,一张图 1 毛 5!
OpenAI 发布了其最新的图像生成模型 API:gpt-image-1,它集成了图像生成、图像编辑和图像变体三大核心功能,支持各种高级功能的定制。与 GPT-4o 不同的是,gpt-image-1 支持更高级的定制,例如输出图像的质量、尺寸、格式和压缩程度,甚至可以选择是否需要透明背景。该 API 的定价也更具竞争力,低质量图像的生成成本低至 0.02 美元。Adobe 和 Canva 等公司已…
AI 前线
❯
个人中心
购物车
优惠劵
今日签到
有新私信
私信列表
搜索
扫码打开当前页
返回顶部
幸运之星正在降临...
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠劵
-
✈优惠劵使用时效:无法使用使用时效:
之前
使用时效:永久有效优惠劵ID:×
没有优惠劵可用!







