-
让 llama.cpp 支持多模态向量模型
本文详细阐述了 Jina AI 团队如何突破 llama.cpp 的现有局限,使其能够支持多模态向量的 GGUF 格式输出。文章指出,尽管 Jina-embeddings-v4 模型已推出 GGUF 版本,但 llama.cpp 的内部管线设计导致其无法在一次运算中同时处理图文信息,限制了多模态向量的生成。为解决此问题,团队对 llama.cpp 进行了深度改造,设计了一套分阶段的五步处理流程,使… -
Sora 2 发布:OpenAI 的最新视频生成模型
本视频介绍 OpenAI 最新的先进视频生成模型 Sora 2,通过多个生成的片段展示其强大功能。该模型能够创建生动、富有表现力且高度逼真的视频,这些视频具有同步音频,并符合各种场景中的物理定律,例如花样滑冰、动漫烟花、桨板运动、太空中的宇航员狗和牛仔特技演员。Sora 2 在物理世界准确性、真实性、可控性和音视频同步方面超越了以往的系统。它可以通过仅限邀请的 iOS 应用访问,目前在美国和加拿大… -
Figma CEO:AI 时代设计、产品与工程的融合
Figma CEO Dylan Field 探讨了 AI 对设计、创造力和协作的深刻影响,特别强调 AI 如何模糊设计、产品和工程角色之间的界限。他概述了 Figma 整合 AI 的基本原则,旨在提升以人为本的设计,并激发创新。Field 详细介绍了 Figma 向多产品平台战略演进的过程,这得益于观察现有用户行为,并通过 Config 和本地聚会等活动培养活跃的社区。他强调了创始人保持产品直觉的… -
OpenAI 第三期播客上线:从 ChatGPT 到智能体,AI 如何重新定义职场与科研
本文总结了 OpenAI 第三期播客的核心内容,由 OpenAI 首席运营官布拉德·莱特卡普和首席经济学家罗尼·查特吉共同参与。播客回顾了 ChatGPT 从 API“游乐场”功能演变为标志性产品的历程,强调其对话界面的普及作用。文章深入探讨了 AI 对生产力的显著提升,尤其是在软件工程和科学研究领域,并预见 AI 将重塑工作模式,促进小企业和新兴市场的快速发展。此外,播客还强调了在 AI 时代,… -
Gemma 3 270M:一款超高效 AI 紧凑模型
本文宣布推出 Gemma 3 270M,这是谷歌 Gemma 系列中的一款新型 2.7 亿参数模型,专为高效且特定领域的 AI 应用而设计。其关键特性包括:具有大词汇量的紧凑架构、极高的能源效率(例如,在 Pixel 9 Pro 上进行 25 次对话仅使用 0.75% 的电池)、强大的指令遵循能力,以及可用于生产的 INT4 感知量化训练 (QAT) 检查点。其核心理念是提倡使用“合适的工具来完成… -
对话王小川:换个身位,做一家「医疗突出」的模型公司
文章是百川智能创始人王小川与极客公园创始人张鹏的深度对话实录。王小川复盘了百川智能从快速扩张到精简团队、聚焦医疗 AI 的战略转型,强调了回归“为人类造医生,为生命建模型”的初心。他详细介绍了医疗大模型 Baichuan-M2 的优异表现,并阐述了“造医生”比单纯追求智能高度更复杂的挑战,包括“提问能力”、“减少幻觉”以及“记忆力与关系理解”等。王小川认为 AI 家庭医生将比无人驾驶更早到来,并提… -
Wan2.2 再次开源数字人:Animate-14B!一键实现电影角色替换和动作驱动
文章详细介绍了通义万相最新开源的 Wan2.2-Animate-14B 数字人视频生成模型。该模型核心功能包括“动作捕捉”(Animation)和“角色替换”(Replacement)两种模式。在动作捕捉模式下,模型能将参考视频中的复杂动作和表情精准迁移到静态角色图像上;在角色替换模式下,可将视频中的角色无缝替换为指定角色,同时精确保留原始动作、表情并与环境光影融合,达到电影级生成质量。技术上,模… -
实测可灵 AI 的新视频模型,它生成的动作戏酷到封神。
文章详细评测了可灵 AI 最新视频模型 2.5 版本的能力,重点对比了其在“运动的超进化”和“表演的超进化”两大方面的显著提升。通过与 2.1 版本的对比,文章展示了 2.5 版本在处理复杂连续动作、物理交互细节、多层次情感表达以及运镜稳定性上的突破。作者通过生成《速度与激情》风格的动作片、跑酷、滑雪、拳击等场景,以及人物从愤怒到克制、阴恻恻的笑、绝望到坚定的眼神等情感戏,直观呈现了可灵 2.5 … -
设计 Agentic Loops (智能体循环)
本文深入探讨了“设计智能体循环”这一新兴技能,这对于最大化利用像 Claude Code 和 Codex CLI 这样的编码智能体的效用至关重要。它将 LLM 智能体定义为在循环中运行工具以实现目标的系统,强调有效使用取决于仔细设计这些工具和循环。文章的很大一部分讨论了“YOLO 模式”(自动执行)的固有危险,提出了安全沙箱(例如,Docker、GitHub Codespaces)或远程执行作为防… -
FAANG 系统设计面试:设计一个聊天系统 (WhatsApp, Facebook Messenger, Discord, Slack)
本文详细介绍了可扩展的实时聊天系统的设计。设计借鉴了 WhatsApp 等平台的思路。它涵盖了从通信协议选择(倾向于使用混合 HTTP 进行发送,WebSocket 进行接收)到包括无状态、有状态和第三方服务的多层系统架构等基本方面。一个关键的关注点是通过“收件箱”模式以及确认机制来实现可靠的离线消息传递。讨论扩展到使用在线状态服务 (Presence Service) 和直接 RPC 调用在多个… -
Google 的 Nano Banana 如何实现突破性的角色一致性
本文重点介绍了 Google 的 Nicole Brichtova 和 Hansa Srinivasan 的一次讨论,内容富有洞察力。他们是 Nano Banana 图像模型背后的产品和工程负责人。他们详细介绍了如何实现前所未有的角色一致性。这一关键特性得益于 Gemini 的多模态架构、广泛的高质量数据和严格的人工评估。讨论还阐明了战略性的 “Gemini 产品体系”,其中像 Nano Bana… -
LangChain Agent 年度报告:输出质量仍是 Agent 最大障碍,客服、研究是最快落地场景
该报告深度剖析了 AI Agent 的最新落地应用情况,基于 LangChain 对 1300 名工程师、产品经理和企业高管的调查,揭示了 Agent 的六大关键结论。报告指出,Agent 已在生产环境中广泛应用(57%),尤其在大型企业中落地更快。客户服务和研究与数据分析是目前最热门的应用方向。然而,Agent 输出的质量和稳定性仍是商业化落地的最大障碍,而成本已不再是核心痛点。同时,Agent… -
黄仁勋交流会 15000 字实录:谈中美芯片、H20、CUDA 兼容,信息量超大
本文详尽记录了英伟达 CEO 黄仁勋在华媒体交流会的核心观点。他高度评价中国供应链的复杂高效和 AI 人才的全球领先地位,并表示 H20 芯片已获批在华销售,未来将推动更多 Blackwell 架构产品落地。黄仁勋对中国厂商开发 CUDA 兼容平台持开放态度,认为 CUDA 本身就是开放的。他还盛赞中国电动汽车和软件能力的创新,指出算力焦虑将持续十年,并预测 AGI 有望在现有技术基础上实现。访谈… -
ChatGPT Agent 系统提示词中文版
文章作为 OpenAI 对 ChatGPT AI 智能体模式的官方指南,详细定义了其行为准则、能力边界和工具使用规范。它明确了智能体在金融活动和敏感个人信息处理上的严格限制,强调了安全浏览的重要性,并提供了浏览器、计算机、容器、图片生成、幻灯片制作等多种工具的详细使用说明和适用场景。此外,文章还规范了报告格式、引文、研究方法、时效性处理、澄清机制和内部消息通道,确保智能体在执行任务时的自主性、准确… -
HTTP 服务客户端增强
本文详细介绍了 Spring 框架 7 中即将推出的 HTTP 服务客户端增强功能,重点是新的 HTTP 服务注册表。该注册表旨在解决管理 Spring 框架 6 引入的 `@HttpExchange` 注解接口时产生的配置开销。该注册表提供了一个结构化的配置模型,用于将 HTTP 服务组织成组,并能以透明方式创建和注册客户端代理(Spring Bean)。本文重点介绍了如何使用 `HttpSer… -
周志华团队新作:LLM 中存在奖励模型,首次理论证明 RL 对 LLM 有效性 | 机器之心
该研究首次从理论上证明了大语言模型(LLMs)内部存在内源性奖励机制,无需依赖昂贵的人类标注数据或外部 AI 反馈。研究团队展示了如何从标准的下一个 Token 预测目标中恢复出离线逆强化学习奖励函数,并通过数学证明使用这种内源性奖励进行微调可以使策略误差界限从 O(H²)改进到 O(H),显著优于基线模型。实验通过三个核心问题验证:1)内源性奖励模型(EndoRM)在多样偏好对上超越显式训练模型… -
奖励模型终于迎来预训练新时代!上海 AI Lab、复旦 POLAR,开启 Scaling 新范式 | 机器之心
文章详细介绍了上海人工智能实验室与复旦大学联合提出的预训练奖励模型 POLAR,旨在解决大语言模型后训练阶段奖励模型面临的数据成本高、泛化能力差等核心问题。POLAR 创新性地引入“策略判别学习”范式,通过对比学习衡量候选策略与最优策略的“距离”,摆脱对人类绝对偏好的依赖。其训练分为大规模自动化合成数据预训练和少量偏好数据微调两阶段。实验结果表明,POLAR 在偏好评估和强化微调(RFT)应用中均… -
利用 Firecrawl 和 OpenAI 实现智能招聘网站数据抓取与分析
本文提供了一个关于自动化招聘网站数据抓取和智能职位匹配的全面教程。它介绍了 Firecrawl,用于处理复杂的网络数据抓取任务,如动态内容和交互操作(点击、滚动),并集成了 OpenAI 的 `gpt-4o` 和 `o1` 模型,用于将非结构化文本解析为结构化数据,并提供智能建议。本指南逐步介绍了环境配置、API 初始化、目标职位抓取、申请链接提取、职位信息提取,以及基于候选人简历的职位推荐。文章… -
全球大模型季报:“犹太人的金融,华人的 AGI”
文章以对话形式呈现最新全球大模型季报,聚焦行业两大关键词:模型分化与产品化。李广密分析指出,除 OpenAI 和 Google 致力于通用模型外,Anthropic、Thinking Machines Lab 等公司正转向 Coding、Agentic、多模态等垂直领域深耕。他强调,AI 产品正从智能探索转向产品壁垒构建,ChatGPT 的成功不仅源于技术,更得益于品牌心智。文章还探讨了“L4 级… -
Greg Brockman:AGI,Sora 2,瓶颈,白领,主动式人工智能,以及更多!
在这次采访中,OpenAI 的 Greg Brockman 提供了对人工智能未来的广泛见解。他解释说,包括 Sora 2 在内的大型模型,从根本上依赖于深度学习和 Transformer 架构,尽管存在不同模式的差异。他强调,我们即将面临算力严重稀缺、能源瓶颈和供应链等多重挑战,突出了 OpenAI 在硬件和基础设施方面的战略投资,例如星门计划以及与 AMD 的合作。Brockman 预计人机交互…
AI 前线
❯
个人中心
购物车
优惠劵
今日签到
有新私信
私信列表
搜索
扫码打开当前页
返回顶部
幸运之星正在降临...
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠劵
-
✈优惠劵使用时效:无法使用使用时效:
之前
使用时效:永久有效优惠劵ID:×
没有优惠劵可用!














