强化学习 on Answer

强化学习 on Answer https://answer.freetools.me/tags/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/ Recent content in 强化学习 on Answer Hugo -- 0.152.2 zh-cn Thu, 12 Mar 2026 14:29:39 +0800 Temperature=0为什么不等于确定性输出：大模型推理非确定性的完整技术解析 https://answer.freetools.me/temperature0%E4%B8%BA%E4%BB%80%E4%B9%88%E4%B8%8D%E7%AD%89%E4%BA%8E%E7%A1%AE%E5%AE%9A%E6%80%A7%E8%BE%93%E5%87%BA%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E9%9D%9E%E7%A1%AE%E5%AE%9A%E6%80%A7%E7%9A%84%E5%AE%8C%E6%95%B4%E6%8A%80%E6%9C%AF%E8%A7%A3%E6%9E%90/ Thu, 12 Mar 2026 14:29:39 +0800 https://answer.freetools.me/temperature0%E4%B8%BA%E4%BB%80%E4%B9%88%E4%B8%8D%E7%AD%89%E4%BA%8E%E7%A1%AE%E5%AE%9A%E6%80%A7%E8%BE%93%E5%87%BA%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E9%9D%9E%E7%A1%AE%E5%AE%9A%E6%80%A7%E7%9A%84%E5%AE%8C%E6%95%B4%E6%8A%80%E6%9C%AF%E8%A7%A3%E6%9E%90/ 深入解析大模型推理非确定性的根本原因：从浮点数非结合性到批量大小变化，从"并发+浮点数"假说的谬误到批量不变性解决方案，全面揭示为什么设置Temperature=0仍然无法获得可复现输出。为什么大模型越思考越聪明：从o1到DeepSeek-R1的推理时计算革命 https://answer.freetools.me/%E4%B8%BA%E4%BB%80%E4%B9%88%E5%A4%A7%E6%A8%A1%E5%9E%8B%E8%B6%8A%E6%80%9D%E8%80%83%E8%B6%8A%E8%81%AA%E6%98%8E%E4%BB%8Eo1%E5%88%B0deepseek-r1%E7%9A%84%E6%8E%A8%E7%90%86%E6%97%B6%E8%AE%A1%E7%AE%97%E9%9D%A9%E5%91%BD/ Mon, 09 Mar 2026 05:19:58 +0800 https://answer.freetools.me/%E4%B8%BA%E4%BB%80%E4%B9%88%E5%A4%A7%E6%A8%A1%E5%9E%8B%E8%B6%8A%E6%80%9D%E8%80%83%E8%B6%8A%E8%81%AA%E6%98%8E%E4%BB%8Eo1%E5%88%B0deepseek-r1%E7%9A%84%E6%8E%A8%E7%90%86%E6%97%B6%E8%AE%A1%E7%AE%97%E9%9D%A9%E5%91%BD/ 深入解析推理时计算扩展如何改变大模型发展范式。从Google DeepMind的test-time compute论文到OpenAI o1和DeepSeek-R1的技术突破，系统阐述两种核心机制（修改提议分布与搜索验证器）、计算最优分配策略、训练与推理计算的权衡分析。包含AIME、GPQA等基准测试数据、DeepSeek-R1四阶段训练流程、自我纠正的困境，以及对推理Scaling Law未来发展的前瞻分析。电梯为何总是等不来：从集选控制到目的楼层调度的百年技术演进 https://answer.freetools.me/%E7%94%B5%E6%A2%AF%E4%B8%BA%E4%BD%95%E6%80%BB%E6%98%AF%E7%AD%89%E4%B8%8D%E6%9D%A5%E4%BB%8E%E9%9B%86%E9%80%89%E6%8E%A7%E5%88%B6%E5%88%B0%E7%9B%AE%E7%9A%84%E6%A5%BC%E5%B1%82%E8%B0%83%E5%BA%A6%E7%9A%84%E7%99%BE%E5%B9%B4%E6%8A%80%E6%9C%AF%E6%BC%94%E8%BF%9B/ Sat, 07 Mar 2026 17:27:44 +0800 https://answer.freetools.me/%E7%94%B5%E6%A2%AF%E4%B8%BA%E4%BD%95%E6%80%BB%E6%98%AF%E7%AD%89%E4%B8%8D%E6%9D%A5%E4%BB%8E%E9%9B%86%E9%80%89%E6%8E%A7%E5%88%B6%E5%88%B0%E7%9B%AE%E7%9A%84%E6%A5%BC%E5%B1%82%E8%B0%83%E5%BA%A6%E7%9A%84%E7%99%BE%E5%B9%B4%E6%8A%80%E6%9C%AF%E6%BC%94%E8%BF%9B/ 深入解析电梯调度算法的百年技术演进：从1924年Otis集选控制系统的诞生，到SCAN/LOOK经典算法的数学原理，再到1990年代目的楼层调度系统的革命性突破。涵盖HC5%处理能力、等待时间与行程时间的权衡、早高峰交通模式分析，以及神经网络与强化学习在现代智能电梯群控中的应用。揭示电梯调度作为NP-hard问题的计算复杂性与工程解决方案。